Articulo de referencia

Problema de comparaciones múltiples

Un ejemplo de coincidencia producida por la manipulación de datos (comparaciones múltiples sin corregir) muestra una correlación entre el número de letras de la palabra ganadora...

Un ejemplo de coincidencia producida por la manipulación de datos (comparaciones múltiples sin corregir) muestra una correlación entre el número de letras de la palabra ganadora de un concurso de ortografía y el número de personas en Estados Unidos que murieron por picaduras de arañas venenosas. Con un conjunto suficientemente grande de variables para el mismo período, es posible encontrar un par de gráficos que muestren una correlación espuria .

El problema de comparaciones múltiples , multiplicidad o pruebas múltiples se produce cuando se realizan muchas pruebas estadísticas sobre el mismo conjunto de datos. Cada prueba tiene su propia probabilidad de error de tipo I (falso positivo), por lo que la probabilidad general de obtener al menos un falso positivo aumenta a medida que crece el número de pruebas. En estadística , esto ocurre cuando se considera simultáneamente un conjunto de inferencias estadísticas [ 1 ] o se estima un subconjunto de parámetros seleccionados a partir de valores observados [ 2 ] .

La probabilidad de falsos positivos se mide mediante la tasa de error familiar (FWER). Cuanto mayor sea el número de inferencias realizadas en una serie de pruebas, mayor será la probabilidad de inferencias erróneas. Se han desarrollado diversas técnicas estadísticas para compensar el número de inferencias realizadas; por ejemplo, exigiendo un umbral de significación más estricto para las comparaciones individuales.

Historia

El problema de las comparaciones múltiples recibió mayor atención en la década de 1950 con el trabajo de estadísticos como Tukey y Scheffé . Durante las décadas siguientes, se desarrollaron muchos procedimientos para abordar el problema. En 1996, tuvo lugar en Tel Aviv la primera conferencia internacional sobre procedimientos de comparaciones múltiples . [ 3 ] Varios investigadores trabajan activamente en este campo, por ejemplo Emmanuel Candès y Vladimir Vovk .

Definición

Generación de un valor p pequeño mediante pruebas múltiples. Se observan 30 muestras de 10 puntos de color aleatorio (azul o rojo). En cada muestra, se realiza una prueba binomial bilateral de la hipótesis nula de que el azul y el rojo son igualmente probables. La primera fila muestra los posibles valores p en función del número de puntos azules y rojos en la muestra. Aunque las 30 muestras se simularon bajo la hipótesis nula, uno de los valores p resultantes es lo suficientemente pequeño como para producir un falso rechazo al nivel típico de 0,05 en ausencia de corrección.

Las comparaciones múltiples surgen cuando un análisis estadístico implica múltiples pruebas estadísticas simultáneas, cada una de las cuales tiene el potencial de producir un "descubrimiento". Un nivel de confianza establecido generalmente se aplica solo a cada prueba considerada individualmente, pero a menudo es deseable tener un nivel de confianza para todo el conjunto de pruebas simultáneas. [ 4 ] No tener en cuenta las comparaciones múltiples puede tener importantes consecuencias en el mundo real, como lo ilustran los siguientes ejemplos:

  • Supongamos que el tratamiento consiste en una nueva forma de enseñar a escribir a los estudiantes, y el control en la forma estándar. Se puede comparar a los estudiantes de ambos grupos en cuanto a gramática, ortografía, organización, contenido, etc. A medida que se comparan más atributos, aumenta la probabilidad de que los grupos de tratamiento y control parezcan diferir en al menos un atributo debido únicamente al error de muestreo aleatorio .
  • Supongamos que consideramos la eficacia de un fármaco en términos de la reducción de cualquiera de los síntomas de una enfermedad. A medida que se consideran más síntomas, aumenta la probabilidad de que el fármaco parezca ser una mejora con respecto a los fármacos existentes en al menos un síntoma.

En ambos ejemplos, a medida que aumenta el número de comparaciones, es más probable que los grupos comparados parezcan diferir en al menos un atributo. Nuestra confianza en que un resultado se generalice a datos independientes suele ser menor si se observa como parte de un análisis que implica múltiples comparaciones, en lugar de un análisis que implica una sola comparación.

Por ejemplo, si se realiza una prueba con un nivel de significancia del 5 % y la hipótesis nula correspondiente es verdadera, existe solo un 5 % de riesgo de rechazarla incorrectamente. Sin embargo, si se realizan 100 pruebas con un nivel de significancia del 5 % y todas las hipótesis nulas correspondientes son verdaderas, el número esperado de rechazos incorrectos (también conocidos como falsos positivos o errores de tipo I ) es 5. Si las pruebas son estadísticamente independientes entre sí (es decir, se realizan sobre muestras independientes), la probabilidad de al menos un rechazo incorrecto es aproximadamente del 99,4 %.

El problema de las comparaciones múltiples también se aplica a los intervalos de confianza . Un único intervalo de confianza con una probabilidad de cobertura del 95 % contendrá el valor real del parámetro en el 95 % de las muestras. Sin embargo, si se consideran simultáneamente 100 intervalos de confianza, cada uno con una probabilidad de cobertura del 95 %, el número esperado de intervalos que no cubren el valor real es 5. Si los intervalos son estadísticamente independientes entre sí, la probabilidad de que al menos un intervalo no contenga el parámetro poblacional es del 99,4 %.

Se han desarrollado técnicas para prevenir la inflación de las tasas de falsos positivos y de no cobertura que se producen con las pruebas estadísticas múltiples.

Clasificación de pruebas de hipótesis múltiples

La siguiente tabla define los posibles resultados al probar múltiples hipótesis nulas. Supongamos que tenemos m hipótesis nulas, denotadas por: H₁ , H₂ , ..., Hₘ .    Mediante una prueba estadística , rechazamos la hipótesis nula si la prueba resulta significativa. No rechazamos la hipótesis nula si la prueba no es significativa. La suma de cada tipo de resultado para todas las Hᵢ produce las  siguientes variables aleatorias:

En m pruebas de hipótesis de las cualesmetro0{\displaystyle m_{0}}son hipótesis nulas verdaderas, R es una variable aleatoria observable y S , T , U y V son variables aleatorias no observables .

Procedimientos de control

P(at least 1 H_0 is wrongly rejected)00.20.40.60.8101020304050P(at least 1 H_0 is wrongly rejected)Probability of rejecting null hypothesis
Probabilidad de que al menos una hipótesis nula sea rechazada erróneamente, paraαpor comparación=0,05{\displaystyle \alpha _{\text{por comparación}}=0,05}, en función del número de pruebas independientesmetro{\displaystyle m}. Ver datos de origen .

Corrección de pruebas múltiples

La corrección por pruebas múltiples consiste en hacer que las pruebas estadísticas sean más rigurosas para contrarrestar el problema de las pruebas múltiples. El ajuste más conocido es la corrección de Bonferroni , pero se han desarrollado otros métodos. Estos métodos suelen estar diseñados para controlar la tasa de error global o la tasa de falsos descubrimientos .

Si se realizan m comparaciones independientes, la tasa de error familiar (FWER) viene dada por

α¯=1(1α{por comparación})metro.{\displaystyle {\bar {\alpha }}=1-\left(1-\alpha _{\{{\text{por comparación}}\}}\right)^{m}.}

Por lo tanto, a menos que las pruebas sean perfectamente dependientes positivamente (es decir, idénticas),α¯{\displaystyle {\bar {\alpha }}}aumenta a medida que aumenta el número de comparaciones. Si no asumimos que las comparaciones son independientes, aún podemos decir:

α¯metroα{por comparación},{\displaystyle {\bar {\alpha }}\leq m\cdot \alpha _{\{{\text{por comparación}}\}},}

lo cual se deduce de la desigualdad de Boole . Ejemplo:0,2649=1(10,05)60,05×6=0,3{\displaystyle 0.2649=1-(1-.05)^{6}\leq .05\times 6=0.3}

Existen diferentes maneras de asegurar que la tasa de error familiar sea como máximoα{\displaystyle \alpha }El método más conservador, que no requiere supuestos de dependencia ni de distribución, es la corrección de Bonferroni .α{pagmir doometropagarisonorte}=α/metro{\displaystyle \alpha _{\mathrm {\{per\ comparison\}} }={\alpha }/m}. Se puede obtener una corrección ligeramente menos conservadora resolviendo la ecuación para la tasa de error familiar demetro{\displaystyle m}comparaciones independientes paraα{pagmir doometropagarisonorte}{\displaystyle \alpha _{\mathrm {\{per\ comparison\}} }}Esto produceα{por comparación}=1(1α)1/metro{\displaystyle \alpha _{\{{\text{per comparison}}\}}=1-{(1-{\alpha })}^{1/m}}, que se conoce como la corrección de Šidák . Otro procedimiento es el método de Holm-Bonferroni , que uniformemente proporciona más potencia que la simple corrección de Bonferroni, al probar solo el valor p más bajo (i=1{\displaystyle i=1}) contra el criterio más estricto y los valores p más altos (i>1{\displaystyle i>1}) frente a criterios progresivamente menos estrictos. [ 5 ]α{pagmir doometropagarisonorte}=α/(metroi+1){\displaystyle \alpha _{\mathrm {\{per\ comparison\}} }={\alpha }/(m-i+1)}.

El método clásico de Bonferroni es fácil de entender, pero no debería utilizarse, ya que es excesivamente conservador. Existen calculadoras en línea para corregir las comparaciones múltiples mediante el método más moderno de Holm-Bonferroni o el procedimiento de Benjamini-Hochberg. [ 6 ]

Para problemas continuos, se puede emplear la lógica bayesiana para calcularmetro{\displaystyle m}a partir de la relación de volumen anterior a posterior. Las generalizaciones continuas de la corrección de Bonferroni y Šidák se presentan en [ 7 ] .

Pruebas múltiples a gran escala

Los métodos tradicionales para el ajuste de comparaciones múltiples se centran en corregir un número moderado de comparaciones, a menudo en un análisis de varianza . Se han desarrollado diferentes técnicas para las "pruebas múltiples a gran escala", en las que se realizan miles o incluso más pruebas. Por ejemplo, en genómica , al utilizar tecnologías como los microarrays , se pueden medir los niveles de expresión de decenas de miles de genes y los genotipos de millones de marcadores genéticos. En particular, en el campo de los estudios de asociación genética , ha habido un grave problema de no replicación: un resultado que es estadísticamente muy significativo en un estudio, pero que no se replica en un estudio posterior. Esta falta de replicación puede tener muchas causas, pero se considera ampliamente que no tener plenamente en cuenta las consecuencias de realizar comparaciones múltiples es una de ellas. [ 8 ] Se ha argumentado que los avances en la medición y la tecnología de la información han facilitado enormemente la generación de grandes conjuntos de datos para el análisis exploratorio , lo que a menudo lleva a la comprobación de un gran número de hipótesis sin ninguna base previa para esperar que muchas de ellas sean verdaderas. En esta situación, se esperan tasas de falsos positivos muy elevadas a menos que se realicen ajustes por comparaciones múltiples.

Para problemas de pruebas a gran escala donde el objetivo es proporcionar resultados definitivos, la tasa de error familiar sigue siendo el parámetro más aceptado para asignar niveles de significancia a las pruebas estadísticas. Alternativamente, si un estudio se considera exploratorio, o si los resultados significativos pueden volver a probarse fácilmente en un estudio independiente, a menudo se prefiere el control de la tasa de falsos descubrimientos (FDR) [ 9 ] [ 10 ] [ 11 ] . La FDR, definida de forma general como la proporción esperada de falsos positivos entre todas las pruebas significativas, permite a los investigadores identificar un conjunto de "posibles positivos" que pueden evaluarse con mayor rigor en un estudio de seguimiento. [ 12 ]

La práctica de intentar muchas comparaciones no ajustadas con la esperanza de encontrar una significativa es un problema conocido, ya sea que se aplique involuntariamente o deliberadamente, a veces se denomina " p-hacking ". [ 13 ] [ 14 ]

Evaluar si alguna hipótesis alternativa es verdadera.

Un gráfico de cuantiles normales para un conjunto simulado de estadísticos de prueba estandarizados como puntuaciones Z bajo la hipótesis nula. La desviación de la cola superior de la distribución respecto a la tendencia esperada a lo largo de la diagonal se debe a la presencia de valores de estadísticos de prueba sustancialmente mayores de los que se esperarían si todas las hipótesis nulas fueran verdaderas. El punto rojo corresponde al cuarto estadístico de prueba observado más grande, que es 3,13, frente a un valor esperado de 2,06. El punto azul corresponde al quinto estadístico de prueba más pequeño, que es -1,75, frente a un valor esperado de -1,96. El gráfico sugiere que es improbable que todas las hipótesis nulas sean verdaderas, y que la mayoría o todas las instancias de una hipótesis alternativa verdadera resultan de desviaciones en la dirección positiva.

Una pregunta fundamental al analizar un gran conjunto de resultados de pruebas es si existe evidencia de que alguna de las hipótesis alternativas sea verdadera. Una metaprueba sencilla que se puede aplicar cuando se asume que las pruebas son independientes entre sí consiste en utilizar la distribución de Poisson como modelo para el número de resultados significativos a un nivel α dado, que se obtendrían si todas las hipótesis nulas fueran verdaderas. Si el número observado de positivos es sustancialmente mayor de lo esperado, esto sugiere que probablemente existan algunos verdaderos positivos entre los resultados significativos.

Por ejemplo, si se realizan 1000 pruebas independientes, cada una con un nivel α  =  0,05, se espera que se produzcan 0,05 × 1000 = 50 pruebas significativas cuando todas las hipótesis nulas son verdaderas. Basándonos en la distribución de Poisson con media 50, la probabilidad de observar más de 61 pruebas significativas es menor que 0,05, por lo que si se observan más de 61 resultados significativos, es muy probable que algunos de ellos correspondan a situaciones en las que la hipótesis alternativa es verdadera. Una desventaja de este enfoque es que sobreestima la evidencia de que algunas de las hipótesis alternativas son verdaderas cuando los estadísticos de prueba están correlacionados positivamente, lo que ocurre comúnmente en la práctica. Por otro lado, el enfoque sigue siendo válido incluso en presencia de correlación entre los estadísticos de prueba, siempre que se pueda demostrar que la distribución de Poisson proporciona una buena aproximación para el número de resultados significativos. Este escenario surge, por ejemplo, al extraer conjuntos de ítems frecuentes significativos de conjuntos de datos transaccionales. Además, un análisis cuidadoso en dos etapas puede limitar la FDR a un nivel preespecificado. [ 15 ]

Otro enfoque común que se puede utilizar en situaciones donde los estadísticos de prueba se pueden estandarizar a puntuaciones Z es realizar un gráfico de cuantiles normales de dichos estadísticos. Si los cuantiles observados presentan una dispersión notablemente mayor que los cuantiles normales, esto sugiere que algunos de los resultados significativos podrían ser verdaderos positivos.

Véase también

Conceptos clave
Procedimientos de un solo paso
Procedimientos "protegidos" de dos etapas
Procedimientos secuenciales
Métodos generales de ajuste alfa para comparaciones múltiples
Conceptos relacionados

Referencias

  1. Miller, RG (1981). Inferencia estadística simultánea, 2.ª ed . Springer Verlag, Nueva York. ISBN 978-0-387-90548-8.
  2. Benjamini, Y. (2010). "Inferencia simultánea y selectiva: éxitos actuales y desafíos futuros". Biometrical Journal . 52 (6): 708– 721. Bibcode : 2010BiomJ..52..708B . doi : 10.1002/bimj.200900299 . PMID 21154895 . S2CID 8806192 .  
  3. "Inicio" . mcp-conference.org .
  4. Kutner, Michael; Nachtsheim, Christopher; Neter, John ; Li, William (2005). Modelos estadísticos lineales aplicados . McGraw-Hill Irwin. págs. 744–745 . ISBN  9780072386882.
  5. Aickin, M; Gensler, H (mayo de 1996). "Ajuste para pruebas múltiples al informar resultados de investigación: los métodos de Bonferroni frente a Holm" . Am J Public Health . 86 (5): 726– 728. doi : 10.2105/ajph.86.5.726 . PMC 1380484. PMID 8629727 .  
  6. Gunnarsson, Ronny K. (2026). "Nivel de significancia" . INFOVOICE.SE .
  7. Bayer, Adrian E.; Seljak, Uroš (2020). "El efecto de mirar hacia otro lado desde una perspectiva bayesiana y frecuentista unificada" . Journal of Cosmology and Astroparticle Physics . 2020 (10): 009. arXiv : 2007.13821 . Bibcode : 2020JCAP...10..009B . doi : 10.1088/1475-7516/2020/10/009 . S2CID 220830693 . 
  8. Qu, Hui-Qi; Tien, Matthew; Polychronakos, Constantin (2010-10-01). " Significación estadística en estudios de asociación genética" . Medicina Clínica e Investigativa . 33 (5): E266– E270. ISSN 0147-958X . PMC 3270946. PMID 20926032 .   
  9. Benjamini, Yoav; Hochberg, Yosef (1995). "Controlando la tasa de falsos descubrimientos: un enfoque práctico y potente para las pruebas múltiples". Journal of the Royal Statistical Society, Serie B. 57 ( 1): 125– 133. doi : 10.1111/j.2517-6161.1995.tb02031.x . JSTOR 2346101 . 
  10. Storey, JD; Tibshirani, Robert (2003). " Significación estadística para estudios de todo el genoma" . PNAS . 100 (16): 9440– 9445. Bibcode : 2003PNAS..100.9440S . doi : 10.1073/pnas.1530509100 . JSTOR 3144228. PMC 170937. PMID 12883005 .   
  11. Efron, Bradley; Tibshirani, Robert; Storey, John D.; Tusher, Virginia (2001). "Análisis bayesiano empírico de un experimento de microarrays". Journal of the American Statistical Association . 96 (456): 1151– 1160. Bibcode : 2001JASA...96.1151E . doi : 10.1198/016214501753382129 . JSTOR 3085878 . S2CID 9076863 .  
  12. Noble, William S. (1 de diciembre de 2009). "¿Cómo funciona la corrección de pruebas múltiples?" . Nature Biotechnology . 27 (12): 1135– 1137. Bibcode : 2009NatBi..27.1135N . doi : 10.1038/nbt1209-1135 . ISSN 1087-0156 . PMC 2907892 . PMID 20010596 .   
  13. Young, SS, Karr, A. (2011). "Deming, datos y estudios observacionales" (PDF) . Significance . 8 (3): 116– 120. doi : 10.1111/j.1740-9713.2011.00506.x .{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  14. Smith, GD, Shah, E. (2002). "Extracción de datos, sesgo o confusión" . BMJ . 325 (7378): 1437– 1438. doi : 10.1136/bmj.325.7378.1437 . PMC 1124898. PMID 12493654 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  15. Kirsch, A; Mitzenmacher, M ; Pietracaprina, A; Pucci, G; Upfal, E ; Vandin, F (junio de 2012). "Un enfoque riguroso y eficiente para identificar conjuntos de ítems frecuentes estadísticamente significativos". Journal of the ACM . 59 (3): 12:1–12:22. arXiv : 1002.1104 . doi : 10.1145/2220357.2220359 .

Lecturas adicionales

  • F. Bretz, T. Hothorn, P. Westfall (2010), Comparaciones múltiples usando R , CRC Press
  • S. Dudoit y MJ van der Laan (2008), Procedimientos de pruebas múltiples con aplicación a la genómica , Springer
  • Farcomeni, A. (2008). "Una revisión de las pruebas de hipótesis múltiples modernas, con especial atención a la proporción de falsos descubrimientos". Métodos estadísticos en la investigación médica . 17 (4): 347– 388. doi : 10.1177/0962280206079046 . hdl : 11573/142139 . PMID 17698936 . S2CID 12777404 .  
  • Phipson, B.; Smyth, GK (2010). "Los valores p de permutación nunca deberían ser cero: cálculo de valores p exactos cuando las permutaciones se extraen aleatoriamente". Aplicaciones estadísticas en genética y biología molecular . 9 : Artículo 39. arXiv : 1603.05766 . doi : 10.2202/1544-6115.1585 . PMID 21044043. S2CID 10735784 .  
  • PH Westfall y SS Young (1993), Pruebas múltiples basadas en remuestreo: ejemplos y métodos para el ajuste del valor p , Wiley
  • P. Westfall, R. Tobias, R. Wolfinger (2011) Comparaciones múltiples y pruebas múltiples con SAS , 2.ª ed., SAS Institute
  • Una galería de ejemplos de correlaciones inverosímiles obtenidas mediante el análisis de datos.
  • Una tira cómica de xkcd sobre el problema de las comparaciones múltiples, usando caramelos de goma y acné como ejemplo.