Articulo de referencia

Prueba de alcance de Tukey

La prueba de rango de Tukey , también conocida como prueba de Tukey , método de Tukey , prueba de significancia honesta de Tukey o prueba HSD ( diferencia honestamente significa...

La prueba de rango de Tukey , también conocida como prueba de Tukey , método de Tukey , prueba de significancia honesta de Tukey o prueba HSD ( diferencia honestamente significativa ) de Tukey , [ 1 ] es un procedimiento de comparación múltiple de un solo paso y una prueba estadística . Se puede utilizar para interpretar correctamente la significancia estadística de la diferencia entre medias que se han seleccionado para la comparación debido a sus valores extremos.

El método fue desarrollado e introducido inicialmente por John Tukey para su uso en el Análisis de Varianza (ANOVA), y generalmente solo se ha enseñado en relación con ANOVA. Sin embargo, la distribución del rango estudentizado utilizada para determinar el nivel de significancia de las diferencias consideradas en la prueba de Tukey tiene una aplicación mucho más amplia: es útil para investigadores que han buscado diferencias notables entre grupos en sus datos recopilados, pero luego no pueden determinar válidamente cuán significativa es su diferencia destacada encontrada utilizando las distribuciones estadísticas estándar utilizadas para otras pruebas estadísticas convencionales, para las cuales los datos deben haber sido seleccionados al azar. Dado que cuando se comparan datos destacados, por definición no fueron seleccionados al azar, sino específicamente elegidos por ser extremos, se necesita una interpretación diferente y más estricta proporcionada por la frecuencia probable y el tamaño del rango estudentizado ; la práctica moderna de " minería de datos " es un ejemplo donde se utiliza.

Desarrollo

La prueba fue ideada por John Tukey , [ 2 ] compara todos los pares posibles de medias y se basa en una distribución de rango estudentizada ( q ) (esta distribución es similar a la distribución de t de la prueba t . Véase más abajo). [ 3 ]

La prueba de Tukey compara las medias de cada tratamiento con las medias de todos los demás tratamientos; es decir, se aplica simultáneamente al conjunto de todas las comparaciones por pares.

μiμj ,{\displaystyle \mu _{i}-\mu _{j}\ ,}

e identifica cualquier diferencia entre dos medias que sea mayor que el error estándar esperado . El coeficiente de confianza para el conjunto , cuando todos los tamaños de muestra son iguales, es exactamente  1α {\displaystyle \ 1-\alpha \ }para cualquier α : 0α1 .{\displaystyle \ \alpha ~:~0\leq \alpha \leq 1~.}Para tamaños de muestra desiguales, el coeficiente de confianza es mayor que 1α .{\displaystyle \ 1-\alpha ~.}En otras palabras, el método de Tukey es conservador cuando los tamaños de muestra son desiguales .

Esta prueba suele ir seguida del procedimiento estadístico de Visualización Compacta de Letras (CLD, por sus siglas en inglés) para que el resultado de esta prueba sea más transparente para un público no especializado en estadística.

Supuestos

  1. Las observaciones que se están analizando son independientes tanto dentro de los grupos como entre ellos.
  2. Los subgrupos asociados a cada media en la prueba siguen una distribución normal .
  3. Existe una varianza intragrupal igual entre los subgrupos asociados con cada media en la prueba ( homogeneidad de varianza ).

El estadístico de prueba

La prueba de Tukey se basa en una fórmula muy similar a la de la prueba t . De hecho, la prueba de Tukey es esencialmente una prueba t , con la diferencia de que corrige la tasa de error familiar .

La fórmula para la prueba de Tukey es

qs= |YAYB|  Smi  ,{\displaystyle q_{\mathsf {s}}={\frac {\ \left|Y_{\mathsf {A}}-Y_{\mathsf {B}}\right|\ }{\ {\mathsf {SE}}\ }}\ ,}

donde Y A y Y B son las dos medias que se comparan, y SE es el error estándar de la suma de las medias. El valor q s es el estadístico de prueba de la muestra. (La notación | x | significa el valor absoluto de x ; la magnitud de x con el signo + , independientemente del signo original de x ).

Este estadístico de prueba q s se puede comparar con un valor q para el nivel de significancia α elegido de una tabla de la distribución del rango estudentizado . Si el valor q s es mayor que el valor crítico q α obtenido de la distribución, se dice que las dos medias son significativamente diferentes al nivel α : 0α1 .{\displaystyle \ \alpha ~:~0\leq \alpha \leq 1~.}[ 3 ]

Dado que la hipótesis nula para la prueba de Tukey establece que todas las medias que se comparan son de la misma población (es decir, μ 1 = μ 2 = μ 3 = ... = μ k ), las medias deben estar distribuidas normalmente (de acuerdo con el teorema del límite central ) con la misma desviación estándar del modelo σ , estimada por el error estándar combinado , Smi ,{\displaystyle \ {\mathsf {SE}}\ ,}Para todas las muestras, su cálculo se analiza en las siguientes secciones. Esto da lugar al supuesto de normalidad de la prueba de Tukey.

La distribución del rango estudentizado ( q )

El método de Tukey utiliza la distribución de rango estudentizado . Supongamos que tomamos una muestra de tamaño n de cada una de las k poblaciones con la misma distribución normal N ( μ , σ 2 ) y supongamos que y¯metroinorte {\displaystyle \ {\bar {y}}_{\mathsf {min}}\ }es la más pequeña de estas medias muestrales y y¯metroaincógnita {\displaystyle \ {\bar {y}}_{\mathsf {max}}\ }es la mayor de estas medias muestrales, y supongamos que S 2 es la varianza muestral combinada de estas muestras. Entonces, la siguiente variable aleatoria tiene una distribución de rango estudentizado:

q y¯metroaincógnitay¯metroinorte  S2/norte {\displaystyle q\equiv {\frac {\ {\overline {y}}_{\mathsf {max}}-{\overline {y}}_{\mathsf {min}}\ }{\ S{\sqrt {2/n}}\ }}}

Esta definición del estadístico q dada anteriormente es la base del valor críticamente significativo para q α que se analiza a continuación, y se basa en estos tres factores:

 α {\displaystyle \ \alpha ~\quad }la tasa de error de tipo I , o la probabilidad de rechazar una hipótesis nula verdadera;
 k {\displaystyle \ k~\quad } el número de subpoblaciones que se comparan;
 dF{\displaystyle \ {\mathsf {df}}\quad }el número de grados de libertad para cada media

(df ​​= Nk ) donde N es el número total de observaciones.)

La distribución de q ha sido tabulada y aparece en muchos libros de texto de estadística. En algunas tablas, la distribución de q ha sido tabulada sin la 2  {\displaystyle \ {\sqrt {2\ }}\ }factor. Para entender de qué tabla se trata, podemos calcular el resultado para k = 2 y compararlo con el resultado de la distribución t de Student con los mismos grados de libertad y el mismo α . Además, R ofrece una función de distribución acumulativa ( ) y una función cuantil ( ) para q .ptukeyqtukey

Límites de confianza

Los límites de confianza de Tukey para todas las comparaciones por pares con un coeficiente de confianza de al menos 1 − α son

y¯iy¯j ±  q α ; k ; nortek  2   σ^ε 2norte :i, j=1,,kij .{\displaystyle {\bar {y}}_{i\bullet }-{\bar {y}}_{j\bullet }\ \pm \ {\frac {\ q_{\ \alpha \ ;\ k\  ;\ Nk}\ }{\ {\sqrt {2\ }}\ }}\ {\widehat {\sigma }}_{\varepsilon }\ {\sqrt {{\frac {2}{n}}\ }}\quad  :\quad i,\ j=1,\ldots ,k\quad i\neq j~.}

Nótese que el estimador puntual y la varianza estimada son los mismos que para una comparación por pares individual. La única diferencia entre los límites de confianza para comparaciones simultáneas y para una comparación individual radica en el múltiplo de la desviación estándar estimada.

Tenga en cuenta también que los tamaños de muestra deben ser iguales cuando se utiliza el método del rango estudentizado. σ^ε {\displaystyle \ {\widehat {\sigma }}_{\varepsilon }\ }es la desviación estándar de todo el diseño, no solo la de los dos grupos que se comparan. Es posible trabajar con tamaños de muestra desiguales. En este caso, se debe calcular la desviación estándar estimada para cada comparación por pares, tal como lo formalizó Clyde Kramer en 1956, por lo que el procedimiento para tamaños de muestra desiguales a veces se denomina método de Tukey-Kramer , que es el siguiente:

y¯iy¯j ±  q α ; k ; nortek  2   σ^ε   1 nortei +  1 nortej  {\displaystyle {\bar {y}}_{i\bullet }-{\bar {y}}_{j\bullet }\ \pm \ {\frac {\ q_{\ \alpha \ ;\ k\  ;\ Nk}\ }{\ {\sqrt {2\ }}\ }}\ {\widehat {\sigma }}_{\varepsilon }\ {\sqrt {\ {\frac {\ 1\ }{n_{i}}}\ +\ {\frac {\ 1\ }{n_{j}}}\ }}\ }

donde n i y n j son los tamaños de los grupos i y j respectivamente. También se aplican los grados de libertad para todo el diseño.

Comparación de las pruebas ANOVA y Tukey-Kramer

Tanto el análisis de varianza (ANOVA) como la prueba de Tukey-Kramer se basan en los mismos supuestos. Sin embargo, estas dos pruebas para k grupos (es decir, μ 1 = μ 2 = ... = μ k ) pueden generar contradicciones lógicas cuando k > 2 , incluso si se cumplen los supuestos.

Es posible generar un conjunto de muestras pseudoaleatorias de medida estrictamente negativa tal que la hipótesis μ 1 = μ 2 se rechace al nivel de significancia 1α>0,95 {\displaystyle \ 1-\alpha >0,95\ }mientras que μ 1 = μ 2 = μ 3 no se rechaza incluso en 1α=0,975 .{\displaystyle \ 1-\alpha =0,975~.}[ 4 ]

Véase también

Referencias

  1. Lowry, Richard. "ANOVA unidireccional: muestras independientes" . Vassar.edu . Archivado del original el 17 de octubre de 2008. Consultado el 4 de diciembre de 2008 .
    También se describe ocasionalmente como "honestamente", véase, por ejemplo
    Morrison, S.; Sosnoff, JJ; Heffernan, KS; Jae, SY; Fernhall, B. (2013). "Envejecimiento, hipertensión y temblor fisiológico: la contribución del impulso cardiobalístico a la génesis del temblor en adultos mayores". Journal of the Neurological Sciences . 326 ( 1– 2): 68– 74. doi : 10.1016/j.jns.2013.01.016 . PMID 23385002 . 
  2. Tukey, John (1949). "Comparación de medias individuales en el análisis de varianza". Biometrics . 5 (2): 99– 114. doi : 10.2307/3001913 . JSTOR 3001913. PMID 18151955 .  
  3. 1 2 Linton, LR; Harder, LD (2007). Apuntes de clase (Informe). Biología 315: Biología cuantitativa. Calgary, AB: Universidad de Calgary.
  4. Gurvich, V.; Naumova, M. (2021). "Contradicciones lógicas en las pruebas de comparaciones múltiples ANOVA unidireccional y Tukey-Kramer con más de dos grupos de observaciones" . Symmetry . 13 (8): 1387. arXiv : 2104.07552 . Bibcode : 2021Symm...13.1387G . doi : 10.3390/sym13081387 .

Lecturas adicionales

  • Montgomery, Douglas C. (2013). Diseño y análisis de experimentos (8.ª  ed.). Wiley. Sección  3.5.7.