Is There Evidence of P-Hacking in Imaging Research?

Background: P-hacking, the tendency to run selective analyses until they become significant, is prevalent in many scientific disciplines. Purpose: This study aims to assess if p-hacking exists in imaging research. Methods: Protocol, data, and code available here https://osf.io/xz9ku/?view%5fonly=a9f...

Descripción completa

Detalles Bibliográficos
Publicado en:Canadian Association of Radiologists Journal Vol. 74; no. 3; pp. 497 - 508
Autores principales: Rooprai, Paul, Islam, Nayaar, Salameh, Jean-Paul, Ebrahimzadeh, Sanam, Kazi, Abrar, Frank, Robert, Ramsay, Tim, Mathur, Maya B., Absi, Marissa, Khalil, Ahmed, Kazi, Sakib, Dawit, Haben, Lam, Eric, Fabiano, Nicholas, McInnes, Matthew D. F.
Formato: research tables/charts Journal Article
Publicado: Sage Publications Inc. Aug2023
Acceso en línea:Ver este registro en EBSCOhost
Descripción
Sumario:Background: P-hacking, the tendency to run selective analyses until they become significant, is prevalent in many scientific disciplines. Purpose: This study aims to assess if p-hacking exists in imaging research. Methods: Protocol, data, and code available here https://osf.io/xz9ku/?view%5fonly=a9f7c2d841684cb7a3616f567db273fa. We searched imaging journals Ovid MEDLINE from 1972 to 2021. Text mining using Python script was used to collect metadata: journal, publication year, title, abstract, and P -values from abstracts. One P -value was randomly sampled per abstract. We assessed for evidence of p-hacking using a p-curve, by evaluating for a concentration of P -values just below.05. We conducted a one-tailed binomial test (α =.05 level of significance) to assess whether there were more P -values falling in the upper range (e.g.,.045 < P <.05) than in the lower range (e.g.,.04 < P <.045). To assess variation in results introduced by our random sampling of a single P -value per abstract, we repeated the random sampling process 1000 times and pooled results across the samples. Analysis was done (divided into 10-year periods) to determine if p-hacking practices evolved over time. Results: Our search of 136 journals identified 967,981 abstracts. Text mining identified 293,687 P -values, and a total of 4105 randomly sampled P -values were included in the p-hacking analysis. The number of journals and abstracts that were included in the analysis as a fraction and percentage of the total number was, respectively, 108/136 (80%) and 4105/967,981 (.4%). P-values did not concentrate just under.05; in fact, there were more P -values falling in the lower range (e.g.,.04 < P <.045) than falling just below.05 (e.g.,.045 < P <.05), indicating lack of evidence for p-hacking. Time trend analysis did not identify p-hacking in any of the five 10-year periods. Conclusion: We did not identify evidence of p-hacking in abstracts published in over 100 imaging journals since 1972. These analyses cannot detect all forms of p-hacking, and other forms of bias may exist in imaging research such as publication bias and selective outcome reporting.
Objectif : Cette étude vise à évaluer si une manipulation des données («data dredging») existe dans la recherche sur l'imagerie. Méthodes : Nous avons mené des recherches dans les journaux d'imagerie de la base de données OVID MEDLINE entre 1972 et 2021. La fouille de textes au moyen d'un script Python a été utilisée pour collecter des métadonnées : journal, année de publication, titre, résumé et valeurs de P ont été extraits des résumés. Une valeur de P a été échantillonnée aléatoirement dans chaque résumé. Nous avons recherché des données probantes de manipulation des données au moyen d'une courbe de P, évaluant la concentration des valeurs de P tout juste inférieures à 0,05. Nous avons mené un test binomial unilatéral pour évaluer s'il y avait davantage de valeurs de P entrant dans la plage supérieure (c'est-à-dire, 0,045 < P < 0,05) que dans la plage inférieure (0,04 < P < 0,045). Pour évaluer la variation des résultats introduite par notre échantillon aléatoire de valeur de P unique pour chaque résumé, nous avons répété le processus d'échantillonnage 1 000 fois et avons regroupé les résultats entre tous les échantillons. Une analyse a été faite (divisée par périodes de 10 ans) pour voir si les pratiques de manipulation des données avaient évolué dans le temps. Résultats : Notre recherche dans 136 journaux a identifié 967 981 résumés. L'extraction de texte a identifiée 293 687 valeurs de P et un total de 4 105 valeurs échantillonnées aléatoirement ont été incluses dans l'analyse de manipulation des données. Les valeurs de P n'étaient pas simplement concentrées juste en dessous de 0,05; en fait, il y avait davantage de valeurs de P entrant dans la plage inférieure (c'est-à-dire, 0,04 < P < 0,045) que juste en dessous de 0,05 (c'est-à-dire, 0,045 < P < 0,05), indiquant une absence de preuve de manipulation des données. La tendance au fil du temps n'a identifié de manipulation des données dans aucune des cinq périodes de 10 ans. Conclusion : Nous n'avons pas identifié de signes de manipulation des données parmi plus de 900 000 résumés publiés dans 136 journaux d'imagerie depuis 1972.