Articulo de referencia

Estadísticas de estimación

La estadística de estimación , o simplemente estimación , es un marco de análisis de datos que utiliza una combinación de tamaños del efecto , intervalos de confianza , planific...

La estadística de estimación , o simplemente estimación , es un marco de análisis de datos que utiliza una combinación de tamaños del efecto , intervalos de confianza , planificación de precisión y metaanálisis para planificar experimentos, analizar datos e interpretar resultados. [ 1 ] Complementa los enfoques de prueba de hipótesis, como la prueba de significación de la hipótesis nula (NHST), al ir más allá de la pregunta de si existe o no un efecto, y proporciona información sobre la magnitud de dicho efecto. [ 2 ] [ 3 ] A la estadística de estimación se la denomina a veces la nueva estadística . [ 3 ] [ 4 ] [ 5 ]

El objetivo principal de los métodos de estimación es informar el tamaño del efecto (una estimación puntual ) junto con su intervalo de confianza , el cual está relacionado con la precisión de la estimación. [ 6 ] El intervalo de confianza resume un rango de valores probables del efecto poblacional subyacente. Los defensores de la estimación consideran que informar un valor p es una distracción inútil de la tarea importante de informar el tamaño del efecto con sus intervalos de confianza, [ 7 ] y creen que la estimación debería reemplazar las pruebas de significancia para el análisis de datos. [ 8 ] [ 9 ]

Historia

A partir de 1929, el físico Raymond Thayer Birge publicó artículos de revisión [ 10 ] en los que utilizó métodos de promedios ponderados para calcular estimaciones de constantes físicas, un procedimiento que puede considerarse el precursor del metaanálisis moderno . [ 11 ]

En la década de 1930, Jerzy Neyman publicó una serie de artículos sobre estimación estadística donde definió las matemáticas y la terminología de los intervalos de confianza . [ 12 ] [ 13 ] [ 14 ]

En la década de 1960, las ciencias no físicas adoptaron la estadística de estimación con el desarrollo del tamaño del efecto estandarizado por Jacob Cohen .

En la década de 1970, Gene V. Glass fue pionero en la síntesis de investigación moderna con la primera revisión sistemática y metaanálisis sobre psicoterapia. [ 15 ] Este trabajo pionero influyó posteriormente en la adopción de metaanálisis para tratamientos médicos en general.

En las décadas de 1980 y 1990, los métodos de estimación fueron ampliados y perfeccionados para su aplicación práctica por bioestadísticos como Larry Hedges , Michael Borenstein, Doug Altman , Martin Gardner y muchos otros, con el desarrollo del metaanálisis (médico) moderno .

A partir de la década de 1980, la revisión sistemática , utilizada junto con el metaanálisis, se convirtió en una técnica ampliamente empleada en la investigación médica. Existen más de 200 000 citas de "metaanálisis" en PubMed .

En la década de 1990, el editor Kenneth Rothman prohibió el uso de valores p en la revista Epidemiology ; el cumplimiento fue alto entre los autores, pero esto no cambió sustancialmente su pensamiento analítico. [ 16 ]

En la década de 2010, Geoff Cumming publicó un libro de texto dedicado a la estadística de estimación, junto con un software en Excel diseñado para enseñar el pensamiento del tamaño del efecto, principalmente a psicólogos. [ 17 ] También en la década de 2010, los métodos de estimación se adoptaron cada vez más en neurociencia. [ 18 ] [ 19 ]

En 2013, el Manual de Publicaciones de la Asociación Americana de Psicología recomendó utilizar la estimación además de la prueba de hipótesis. [ 20 ] También en 2013, el documento Requisitos Uniformes para Manuscritos Presentados a Revistas Biomédicas hizo una recomendación similar: «Evite depender únicamente de pruebas de hipótesis estadísticas, como los valores p, que no transmiten información importante sobre el tamaño del efecto». [ 21 ]

En 2019, más de 800 científicos firmaron un comentario abierto pidiendo que se abandonara por completo el concepto de significación estadística. [ 22 ]

En 2019, la revista eNeuro de la Sociedad de Neurociencia estableció una política que recomendaba el uso de gráficos de estimación como método preferido para la presentación de datos. [ 23 ] Y en 2022, la Sociedad Internacional de Editores de Revistas de Fisioterapia recomendó el uso de métodos de estimación en lugar de pruebas estadísticas de hipótesis nula. [ 24 ]

A pesar de la amplia adopción del metaanálisis para la investigación clínica y las recomendaciones de varias instituciones editoriales importantes, el marco de estimación no se utiliza de forma rutinaria en la investigación biomédica primaria. [ 25 ]

Metodología

Muchas pruebas de significancia tienen una contraparte de estimación; [ 26 ] en casi todos los casos, el resultado de la prueba (o su valor p ) puede sustituirse simplemente por el tamaño del efecto y una estimación de precisión. Por ejemplo, en lugar de usar la prueba t de Student , el analista puede comparar dos grupos independientes calculando la diferencia de medias y su intervalo de confianza del 95 % . Se pueden usar métodos correspondientes para una prueba t pareada y comparaciones múltiples. De manera similar, para un análisis de regresión, un analista informaría el coeficiente de determinación (R² ) y la ecuación del modelo en lugar del valor p del modelo.

Sin embargo, los defensores de las estadísticas de estimación advierten contra la presentación de solo unos pocos números. En cambio, se recomienda analizar y presentar los datos mediante visualización de datos. [ 2 ] [ 5 ] [ 6 ] Ejemplos de visualizaciones apropiadas incluyen el diagrama de dispersión para regresión y los diagramas de Gardner-Altman para dos grupos independientes. [ 27 ] Si bien los gráficos de grupos de datos históricos (gráficos de barras, diagramas de caja y diagramas de violín) no muestran la comparación, los gráficos de estimación agregan un segundo eje para visualizar explícitamente el tamaño del efecto. [ 28 ]

Gráfico de Gardner-Altman. Izquierda: Un gráfico de barras convencional, que utiliza asteriscos para indicar que la diferencia es estadísticamente significativa. Derecha: Un gráfico de Gardner-Altman que muestra todos los puntos de datos, junto con la diferencia media y sus intervalos de confianza.

Trama de Gardner-Altman

El gráfico de diferencia media de Gardner-Altman fue descrito por primera vez por Martin Gardner y Doug Altman en 1986; [ 27 ] es un gráfico estadístico diseñado para mostrar datos de dos grupos independientes. [ 5 ] También hay una versión adecuada para datos pareados . Las instrucciones clave para hacer este gráfico son las siguientes: (1) mostrar todos los valores observados para ambos grupos uno al lado del otro; (2) colocar un segundo eje a la derecha, desplazado para mostrar la escala de diferencia media; y (3) trazar la diferencia media con su intervalo de confianza como un marcador con barras de error. [ 3 ] Los gráficos de Gardner-Altman se pueden generar con DABEST-Python o dabestr ; alternativamente, el analista puede usar software GUI como la aplicación Estimation Stats .

Gráfico de Cumming. Un gráfico de Cumming generado por la aplicación web EstimationStats . En el panel superior, se muestran todos los valores observados. Los tamaños del efecto, la distribución muestral y los intervalos de confianza del 95 % se representan en ejes separados debajo de los datos brutos. Para cada grupo, las mediciones resumidas (media ± desviación estándar) se muestran como líneas discontinuas.

Plan Cumming

Para grupos múltiples, Geoff Cumming introdujo el uso de un panel secundario para graficar dos o más diferencias de medias y sus intervalos de confianza, ubicado debajo del panel de valores observados; [ 3 ] esta disposición permite una fácil comparación de las diferencias de medias ('deltas') en varios grupos de datos. Los gráficos de Cumming se pueden generar con el paquete ESCI , DABEST o la aplicación Estimation Stats .

Otras metodologías

Además de la diferencia media, existen numerosos otros tipos de tamaño del efecto , todos con beneficios relativos. Los tipos principales incluyen tamaños del efecto en la clase d de Cohen de métricas estandarizadas y el coeficiente de determinación (R² ) para el análisis de regresión . Para distribuciones no normales, existen varios tamaños del efecto más robustos , incluyendo la delta de Cliff y el estadístico de Kolmogorov-Smirnov .

Fallos en las pruebas de hipótesis

En las pruebas de hipótesis , el objetivo principal de los cálculos estadísticos es obtener un valor p , la probabilidad de observar un resultado determinado, o un resultado más extremo, al asumir que la hipótesis nula es verdadera. Si el valor p es bajo (generalmente < 0,05), se recomienda al estadístico rechazar la hipótesis nula. Los defensores de la estimación rechazan la validez de las pruebas de hipótesis [ 3 ] [ 6 ] por las siguientes razones, entre otras:

  • Los valores p se malinterpretan con facilidad y frecuencia. Por ejemplo, a menudo se piensa erróneamente que el valor p es "la probabilidad de que la hipótesis nula sea verdadera".
  • La hipótesis nula siempre es errónea para cualquier conjunto de observaciones: siempre existe algún efecto, aunque sea minúsculo. [ 29 ]
  • Las pruebas de hipótesis producen respuestas dicotómicas de sí o no, descartando información importante sobre la magnitud. [ 30 ]
  • Cualquier valor p particular surge de la interacción del tamaño del efecto , el tamaño de la muestra (en igualdad de condiciones, un tamaño de muestra mayor produce un valor p menor) y el error de muestreo. [ 31 ]
  • A baja potencia , la simulación revela que el error de muestreo hace que los valores p sean extremadamente volátiles. [ 32 ]

Beneficios de la estadística de estimación

Cuantificación

Mientras que los valores p se centran en respuestas de sí o no, la estimación dirige la atención del analista hacia la cuantificación.

Ventajas de los intervalos de confianza

Los intervalos de confianza se comportan de manera predecible. Por definición, los intervalos de confianza del 95 % tienen una probabilidad del 95 % de cubrir la media poblacional subyacente (μ). Esta característica permanece constante con el aumento del tamaño de la muestra; lo que cambia es que el intervalo se vuelve más pequeño. Además, los intervalos de confianza del 95 % también son intervalos de predicción del 83 %: un intervalo de confianza (preexperimental) tiene una probabilidad del 83 % de cubrir la media de cualquier experimento futuro. [ 3 ] Por lo tanto, conocer los intervalos de confianza del 95 % de un solo experimento le da al analista un rango razonable para la media poblacional. Sin embargo, las distribuciones de confianza y las distribuciones posteriores proporcionan mucha más información que una sola estimación puntual o intervalos, [ 33 ] lo que puede exacerbar el pensamiento dicotómico según el intervalo cubra o no cubra un valor "nulo" de interés (es decir, el comportamiento inductivo de Neyman en contraposición al de Fisher [ 34 ] ).

Estadísticas basadas en la evidencia

Los estudios psicológicos sobre la percepción de las estadísticas revelan que informar estimaciones de intervalos produce una percepción más precisa de los datos que informar valores p. [ 35 ]

Planificación de precisión

La precisión de una estimación se define formalmente como 1/ varianza y, al igual que la potencia, aumenta (mejora) con el aumento del tamaño de la muestra. Al igual que la potencia , un alto nivel de precisión es costoso; idealmente, las solicitudes de subvenciones para investigación deberían incluir análisis de precisión/costo. Los defensores de la estimación creen que la planificación de precisión debería reemplazar la potencia, ya que la potencia estadística en sí misma está conceptualmente vinculada a las pruebas de significancia. [ 3 ] La planificación de precisión se puede realizar con la aplicación web ESCI .

Véase también

Referencias

  1. Ellis, Paul. "Preguntas frecuentes sobre el tamaño del efecto" .
  2. 1 2 Cohen, Jacob. "La Tierra es redonda (p<.05)" (PDF) . Archivado del original (PDF) el 11-10-2017 . Recuperado el 22-08-2013 .
  3. 1 2 3 4 5 6 7 Cumming, Geoff (2011). Comprender las nuevas estadísticas: tamaños del efecto, intervalos de confianza y metaanálisis . Nueva York: Routledge. ISBN 978-0-415-87967-5.
  4. Altman, Douglas (1991). Estadística práctica para la investigación médica . Londres: Chapman and Hall.
  5. 1 2 3 Douglas Altman, ed. (2000). Estadística con confianza . Londres: Wiley-Blackwell.
  6. 1 2 3 Cohen, Jacob (1990). "Cosas que he aprendido (hasta ahora)" . American Psychologist . 45 (12): 1304– 1312. doi : 10.1037/0003-066x.45.12.1304 .
  7. Ellis, Paul (31 de mayo de 2010). "¿Por qué no puedo simplemente juzgar mi resultado mirando el valor p?" . Preguntas frecuentes sobre el tamaño del efecto . Consultado el 5 de junio de 2013 .
  8. Claridge-Chang, Adam; Assam, Pryseley N (2016). " Las estadísticas de estimación deberían reemplazar las pruebas de significancia" . Nature Methods . 13 (2): 108– 109. doi : 10.1038/nmeth.3729 . PMID 26820542. S2CID 205424566 .  
  9. Berner, Daniel; Amrhein, Valentin (2022). "Por qué y cómo deberíamos unirnos al cambio de las pruebas de significancia a la estimación" . Journal of Evolutionary Biology . 35 (6): 777– 787. Bibcode : 2022JEBio..35..777B . doi : 10.1111 / jeb.14009 . ISSN 1010-061X . PMC 9322409. PMID 35582935. S2CID 247788899 .    
  10. Birge, Raymond T. (1929). "Valores probables de las constantes físicas generales". Reviews of Modern Physics . 1 (1): 1– 73. Bibcode : 1929RvMP....1....1B . doi : 10.1103/RevModPhys.1.1 .
  11. Hedges, Larry (1987). "Qué tan dura es la ciencia dura, qué tan blanda es la ciencia blanda". American Psychologist . 42 (5): 443. CiteSeerX 10.1.1.408.2317 . doi : 10.1037/0003-066x.42.5.443 . 
  12. Neyman, Jerzy (1934). "Sobre los dos aspectos diferentes del método representativo: el método de muestreo estratificado y el método de selección intencional". Journal of the Royal Statistical Society . 97 (4): 558– 625. doi : 10.2307/2342192 . JSTOR 2342192 . (Véase la nota I en el apéndice)
  13. Neyman, J. (1935). "Sobre el problema de los intervalos de confianza". The Annals of Mathematical Statistics . 6 (3): 111– 116. doi : 10.1214/aoms/1177732585 .
  14. Neyman, J. (1937). "Esquema de una teoría de estimación estadística basada en la teoría clásica de la probabilidad". Philosophical Transactions of the Royal Society of London. Serie A, Ciencias Matemáticas y Físicas . 236 (767): 333– 380. Bibcode : 1937RSPTA.236..333N . doi : 10.1098/rsta.1937.0005 . JSTOR 91337 . 
  15. Hunt, Morton (1997). Cómo la ciencia hace balance: la historia del metaanálisis . Nueva York: The Russell Sage Foundation. ISBN 978-0-87154-398-1.
  16. Fidler, Fiona; Thomason, Neil; Cumming, Geoff; Finch, Sue; Leeman, Joanna (2004). "Los editores pueden guiar a los investigadores hacia intervalos de confianza, pero no pueden hacerles pensar: lecciones de reforma estadística de la medicina". Psychological Science . 15 (2): 119– 126. doi : 10.1111/j.0963-7214.2004.01502008.x . PMID 14738519. S2CID 21199094 .  
  17. Cumming, Geoff. "ESCI (Software exploratorio para intervalos de confianza)" . Archivado del original el 29 de diciembre de 2013. Consultado el 12 de mayo de 2013 .
  18. Yildizoglu, Tugce; Weislogel, Jan-Marek; Mohammad, Farhan; ​​Chan, Edwin S.-Y.; Assam, Pryseley N.; Claridge-Chang, Adam (2015). "Estimación del procesamiento de información en un sistema de memoria: la utilidad de los métodos meta-analíticos para la genética" . PLOS Genetics . 11 (12) e1005718. doi : 10.1371/journal.pgen.1005718 . PMC 4672901. PMID 26647168 .  
  19. Hentschke, Harald; Maik C. Stüttgen (2011). "Cálculo de medidas del tamaño del efecto para conjuntos de datos de neurociencia". European Journal of Neuroscience . 34 (12): 1887– 1894. doi : 10.1111/j.1460-9568.2011.07902.x . PMID 22082031 . S2CID 12505606 .  
  20. "Manual de Publicaciones de la Asociación Americana de Psicología, Sexta Edición" . Archivado del original el 5 de marzo de 2013.
  21. "Requisitos uniformes para los manuscritos enviados a revistas biomédicas" . Archivado del original el 15 de mayo de 2013.
  22. Amrhein, Valentin; Greenland, Sander; McShane, Blake (2019). "Los científicos se rebelan contra la significación estadística" , Nature 567, 305-307.
  23. Bernard, Christophe (2019). " Cambiar la forma en que informamos, interpretamos y discutimos nuestros resultados para reconstruir la confianza en nuestra investigación" . eNeuro . 6 (4). doi : 10.1523/ENEURO.0259-19.2019 . PMC 6709206. PMID 31453315 .  
  24. Elkins, Mark; et al. (2022). "Inferencia estadística a través de la estimación: recomendaciones de los editores de la revista de la Sociedad Internacional de Fisioterapia" , Journal of Physiotherapy, 68 (1), 1-4.
  25. Halsey, Lewis G. (2019). "El reinado del valor p ha terminado: ¿qué análisis alternativos podríamos emplear para llenar el vacío de poder?" . Biology Letters . 15 (5) 20190174. Bibcode : 2019BiLet..1590174H . doi : 10.1098/rsbl.2019.0174 . PMC 6548726 . PMID 31113309 .  
  26. Cumming, Geoff; Calin-Jageman, Robert (2016). Introducción a la nueva estadística: estimación, ciencia abierta y más allá . Routledge. ISBN 978-1-138-82552-9.
  27. 1 2 Gardner, MJ; Altman, DG (1986). " Intervalos de confianza en lugar de valores P: estimación en lugar de prueba de hipótesis" . BMJ . 292 (6522): 746– 750. doi : 10.1136/bmj.292.6522.746 . PMC 1339793. PMID 3082422 .  
  28. Ho, Joses; Tumkaya, Tayfun; Aryal, Sameer; Choi, Hyungwon; Claridge-Chang, Adam (2019). "Más allá de los valores P: análisis de datos con gráficos de estimación". Nature Methods . 16 (7): 565– 566. bioRxiv 10.1101/377978 . doi : 10.1038/s41592-019-0470-3 . PMID 31217592 .  
  29. Cohen, Jacob (1994). "La Tierra es redonda (p < .05)". American Psychologist . 49 (12): 997– 1003. doi : 10.1037/0003-066X.49.12.997 .
  30. Ellis, Paul (2010). La guía esencial sobre el tamaño del efecto: potencia estadística, metaanálisis e interpretación de los resultados de la investigación . Cambridge: Cambridge University Press.
  31. Denton E. Morrison, Ramon E. Henkel, ed. (2006). La controversia de la prueba de significancia: una antología . Aldine Transaction. ISBN 978-0-202-30879-1.
  32. Cumming, Geoff (3 de marzo de 2009). "Danza de los valores p" . YouTube .
  33. Xie, Min-ge; Singh, Kesar (2013). "Distribución de confianza, el estimador de distribución frecuentista de un parámetro: una revisión". International Statistical Review . 81 (1): 3– 39. doi : 10.1111/insr.12000 . JSTOR 43298799. S2CID 3242459 .  
  34. Halpin, Peter F.; Stam, Henderikus J. (2006). "Inferencia inductiva o comportamiento inductivo: Fisher y Neyman: Enfoques de Pearson para las pruebas estadísticas en la investigación psicológica (1940-1960)". The American Journal of Psychology . 119 (4): 625– 653. doi : 10.2307/20445367 . JSTOR 20445367. PMID 17286092 .  
  35. Beyth-Marom, Ruth; Fidler, Fiona Margaret; Cumming, Geoffrey David (2008). "Cognición estadística: Hacia una práctica basada en la evidencia en estadística y educación estadística". Statistics Education Research Journal . 7 (2): 20– 39. CiteSeerX 10.1.1.154.7648 . doi : 10.52041/serj.v7i2.468 . S2CID 18902043 .