Articulo de referencia

Análisis de varianza unidireccional

En estadística , el análisis de varianza unidireccional (o ANOVA unidireccional ) es una técnica para comparar si las medias de dos o más muestras son significativamente diferen...

En estadística , el análisis de varianza unidireccional (o ANOVA unidireccional ) es una técnica para comparar si las medias de dos o más muestras son significativamente diferentes (utilizando la distribución F ). Esta técnica de análisis de varianza requiere una variable de respuesta numérica "Y" y una única variable explicativa "X", de ahí el nombre "unidireccional". [ 1 ]

El ANOVA pone a prueba la hipótesis nula , que establece que las muestras de todos los grupos provienen de poblaciones con los mismos valores medios. Para ello, se realizan dos estimaciones de la varianza poblacional. Estas estimaciones se basan en diversas suposiciones ( véase más adelante ). El ANOVA produce un estadístico F, que es la razón entre la varianza calculada entre las medias y la varianza dentro de las muestras. Si las medias de los grupos provienen de poblaciones con los mismos valores medios, la varianza entre las medias de los grupos debería ser menor que la varianza de las muestras, según el teorema del límite central . Por lo tanto, una razón mayor implica que las muestras provienen de poblaciones con diferentes valores medios. [ 1 ]

Normalmente, sin embargo, el ANOVA unidireccional se utiliza para comprobar las diferencias entre al menos tres grupos, ya que el caso de dos grupos puede cubrirse con una prueba t (Gosset, 1908). Cuando solo hay dos medias que comparar, la prueba t y la prueba F son equivalentes; la relación entre ANOVA y t viene dada por F  = . Una extensión del ANOVA unidireccional es el análisis de varianza bidireccional , que examina la influencia de dos variables independientes categóricas diferentes sobre una variable dependiente. 

Supuestos

Los resultados de un ANOVA unidireccional pueden considerarse fiables siempre que se cumplan los siguientes supuestos:

Las principales variantes son: Si los datos son ordinales , se debe utilizar una alternativa no paramétrica a esta prueba, como el análisis de varianza unidireccional de Kruskal-Wallis . Si no se sabe si las varianzas son iguales, se puede utilizar una generalización de la prueba t de Welch para dos muestras . [ 2 ]

Desviaciones de la normalidad poblacional

ANOVA es un procedimiento relativamente robusto con respecto a las violaciones del supuesto de normalidad. [ 3 ]

El ANOVA unidireccional se puede generalizar a los diseños factoriales y multivariados, así como al análisis de covarianza .

En la literatura popular se suele afirmar que ninguna de estas pruebas F es robusta cuando existen violaciones graves del supuesto de que cada población sigue una distribución normal , especialmente para niveles alfa pequeños y diseños desequilibrados. [ 4 ] Además, también se afirma que si se viola el supuesto subyacente de homocedasticidad , las propiedades del error de tipo I se deterioran mucho más gravemente. [ 5 ]

Sin embargo, esto es una idea errónea, basada en trabajos realizados en la década de 1950 y anteriores. La primera investigación exhaustiva del tema mediante simulación de Monte Carlo fue realizada por Donaldson (1966). [ 6 ] Demostró que bajo las desviaciones habituales (asimetría positiva, varianzas desiguales) "la prueba F es conservadora", y por lo tanto es menos probable de lo que debería ser encontrar que una variable es significativa. Sin embargo, a medida que aumenta el tamaño de la muestra o el número de celdas, "las curvas de potencia parecen converger a la basada en la distribución normal". Tiku (1971) encontró que "la potencia de la teoría no normal de F difiere de la potencia de la teoría normal por un término de corrección que disminuye drásticamente con el aumento del tamaño de la muestra". [ 7 ] El problema de la no normalidad, especialmente en muestras grandes, es mucho menos grave de lo que sugieren los artículos populares.

La opinión actual es que "los estudios de Montecarlo se utilizaron ampliamente con pruebas basadas en la distribución normal para determinar su sensibilidad a las violaciones del supuesto de distribución normal de las variables analizadas en la población. La conclusión general de estos estudios es que las consecuencias de tales violaciones son menos graves de lo que se pensaba anteriormente. Si bien estas conclusiones no deberían desalentar por completo la preocupación por el supuesto de normalidad, han aumentado la popularidad general de las pruebas estadísticas dependientes de la distribución en todas las áreas de investigación". [ 8 ]

Para alternativas no paramétricas en el diseño factorial, véase Sawilowsky. [ 9 ] Para más información, véase ANOVA sobre rangos .

El caso de efectos fijos, experimento totalmente aleatorio, datos desequilibrados

El modelo

El modelo lineal normal describe grupos de tratamiento con distribuciones de probabilidad que son curvas normales (en forma de campana) idénticas, pero con medias diferentes. Por lo tanto, para ajustar los modelos solo se requieren las medias de cada grupo de tratamiento y el cálculo de la varianza (se utiliza la varianza promedio dentro de los grupos de tratamiento). Los cálculos de las medias y la varianza se realizan como parte de la prueba de hipótesis.

Los modelos lineales normales comúnmente utilizados para un experimento completamente aleatorio son: [ 10 ]

yi,j=μj+εi,j{\displaystyle y_{i,j}=\mu _{j}+\varepsilon _{i,j}} (el modelo de medios)

o

yi,j=μ+τj+εi,j{\displaystyle y_{i,j}=\mu +\tau _{j}+\varepsilon _{i,j}} (el modelo de efectos)

dónde

i=1,,I{\displaystyle i=1,\dotsc ,I}es un índice sobre unidades experimentales
j=1,,J{\displaystyle j=1,\dotsc ,J}es un índice sobre los grupos de tratamiento
Ij{\displaystyle I_{j}}es el número de unidades experimentales en el j-ésimo grupo de tratamiento
I=jIj{\displaystyle I=\sum _{j}I_{j}}es el número total de unidades experimentales
yi,j{\displaystyle y_{i,j}}son observaciones
μj{\displaystyle \mu _{j}}es la media de las observaciones para el j-ésimo grupo de tratamiento
μ{\displaystyle \mu }es la media general de las observaciones
τj{\displaystyle \tau _{j}}es el j-ésimo efecto del tratamiento, una desviación de la media general
τj=0{\displaystyle \sum \tau _{j}=0}
μj=μ+τj{\displaystyle \mu _{j}=\mu +\tau _{j}}
εnorte(0,σ2){\displaystyle \varepsilon \thicksim N(0,\sigma ^{2})},εi,j{\displaystyle \varepsilon _{i,j}}son errores aleatorios con media cero y distribución normal.

El índicei{\displaystyle i}Las unidades experimentales pueden interpretarse de varias maneras. En algunos experimentos, la misma unidad experimental está sujeta a una gama de tratamientos;i{\displaystyle i}puede señalar una unidad en particular. En otros casos, cada grupo de tratamiento tiene un conjunto distinto de unidades experimentales;i{\displaystyle i}puede ser simplemente un índice en elj{\displaystyle j}-lista.

Los datos y los resúmenes estadísticos de los datos

Una forma de organizar las observaciones experimentalesyij{\displaystyle y_{ij}} está con grupos en columnas:

Comparación del modelo con los resúmenes:μ=metro{\displaystyle \mu =m}yμj=metroj{\displaystyle \mu _{j}=m_{j}}La media general y la varianza general se calculan a partir de las sumas generales, no a partir de las medias y varianzas de los grupos.

La prueba de hipótesis

A partir de las estadísticas descriptivas , los cálculos de la prueba de hipótesis se muestran en forma tabular. Si bien se muestran dos columnas de SS para su valor explicativo, solo se requiere una columna para mostrar los resultados.

METROSmirror{\displaystyle MS_{Error}}es la estimación de la varianza correspondiente aσ2{\displaystyle \sigma ^{2}}del modelo.

Resumen del análisis

El análisis ANOVA central consiste en una serie de cálculos. Los datos se recopilan en forma tabular. Luego

  • Cada grupo de tratamiento se resume mediante el número de unidades experimentales, dos sumas, una media y una varianza. Los resúmenes de los grupos de tratamiento se combinan para obtener los totales del número de unidades y las sumas. La media general y la varianza general se calculan a partir de las sumas generales. Las medias de los tratamientos y las medias generales se utilizan en el modelo.
  • Los tres DF y SS se calculan a partir de los resúmenes. Luego se calculan los MS y una razón determina F.
  • Normalmente, un ordenador calcula un valor p a partir de F, que determina si los tratamientos producen resultados significativamente diferentes. Si el resultado es significativo, el modelo tiene validez provisional.

Si el experimento está equilibrado, todos losIj{\displaystyle I_{j}}Los términos son iguales, por lo que las ecuaciones SS se simplifican.

En un experimento más complejo, donde las unidades experimentales (o efectos ambientales) no son homogéneas, también se utilizan estadísticas de fila en el análisis. El modelo incluye términos que dependen de i{\displaystyle i}Determinar los términos adicionales reduce el número de grados de libertad disponibles.

Ejemplo

Consideremos un experimento para estudiar el efecto de tres niveles diferentes de un factor sobre una respuesta (por ejemplo, tres niveles de fertilizante sobre el crecimiento de las plantas). Si tuviéramos 6 observaciones para cada nivel, podríamos escribir el resultado del experimento en una tabla como esta, donde a₁, a₂ y a₃ son los tres niveles del factor estudiado.

La hipótesis nula, denotada H₀ , para la prueba F general de este experimento sería que los tres niveles del factor producen la misma respuesta, en promedio. Para calcular la razón F :

Paso 1: Calcular la media dentro de cada grupo:

Y¯1=16Y1i=6+8+4+5+3+46=5Y¯2=16Y2i=8+12+9+11+6+86=9Y¯3=16Y3i=13+9+11+8+7+126=10{\displaystyle {\begin{aligned}{\overline {Y}}_{1}&={\frac {1}{6}}\sum Y_{1i}={\frac {6+8+4+5+3+4}{6}}=5\\{\overline {Y}}_{2}&={\frac {1}{6}}\sum Y_{2i}={\frac {8+12+9+11+6+8}{6}}=9\\{\overline {Y}}_{3}&={\frac {1}{6}}\sum Y_{3i}={\frac {13+9+11+8+7+12}{6}}=10\end{aligned}}}

Paso 2: Calcular la media general:

Y¯=iY¯ia=Y¯1+Y¯2+Y¯3a=5+9+103=8{\displaystyle {\overline {Y}}={\frac {\sum _{i}{\overline {Y}}_{i}}{a}}={\frac {{\overline {Y}}_{1}+{\overline {Y}}_{2}+{\overline {Y}}_{3}}{a}}={\frac {5+9+10}{3}}=8}
donde a es el número de grupos.

Paso 3: Calcular la suma de las diferencias al cuadrado "entre grupos":

SB=norte(Y¯1Y¯)2+norte(Y¯2Y¯)2+norte(Y¯3Y¯)2=6(58)2+6(98)2+6(108)2=84{\displaystyle {\begin{aligned}S_{B}&=n({\overline {Y}}_{1}-{\overline {Y}})^{2}+n({\overline {Y}}_{2}-{\overline {Y}})^{2}+n({\overline {Y}}_{3}-{\overline {Y}})^{2}\\[8pt]&=6(5-8)^{2}+6(9-8)^{2}+6(10-8)^{2}=84\end{aligned}}}

donde n es el número de valores de datos por grupo.

Los grados de libertad entre grupos son uno menos que el número de grupos.

Fb=31=2{\displaystyle f_{b}=3-1=2}

por lo que el valor cuadrático medio entre grupos es

METROSB=84/2=42{\displaystyle MS_{B}=84/2=42}

Paso 4: Calcular la suma de cuadrados "dentro del grupo". Comience por centrar los datos en cada grupo.

La suma de cuadrados dentro del grupo es la suma de cuadrados de los 18 valores de esta tabla.

SW=(1)2+(3)2+(1)2+(0)2+(2)2+(1)2+(1)2+(3)2+(0)2+(2)2+(3)2+(1)2+(3)2+(1)2+(1)2+(2)2+(3)2+(2)2= 1+9+1+0+4+1+1+9+0+4+9+1+9+1+1+4+9+4= 68{\displaystyle {\begin{aligned}S_{W}=&(1)^{2}+(3)^{2}+(-1)^{2}+(0)^{2}+(-2)^{2}+(-1)^{2}+\\&(-1)^{2}+(3)^{2}+(0)^{2}+(2)^{2}+(-3)^{2}+(-1)^{2}+\\&(3)^{2}+(-1)^{2}+(1)^{2}+(-2)^{2}+(-3)^{2}+(2)^{2}\\=&\ 1+9+1+0+4+1+1+9+0+4+9+1+9+1+1+4+9+4\\=&\ 68\\\end{aligned}}}

Los grados de libertad dentro del grupo son

FW=a(norte1)=3(61)=15{\displaystyle f_{W}=a(n-1)=3(6-1)=15}

Por lo tanto, el valor cuadrático medio dentro del grupo es

METROSW=SW/FW=68/154.5{\displaystyle MS_{W}=S_{W}/f_{W}=68/15\approx 4.5}

Paso 5: La razón F es

F=METROSBMETROSW42/4.59.3{\displaystyle F={\frac {MS_{B}}{MS_{W}}}\approx 42/4.5\approx 9.3}

El valor crítico es el número que el estadístico de prueba debe superar para rechazar la prueba. En este caso, F crit (2,15) = 3,68 con α = 0,05. Dado que F = 9,3  >  3,68, los resultados son significativos al nivel de significancia del 5 %. No se aceptaría la hipótesis nula, concluyendo que existe evidencia sólida de que los valores esperados en los tres grupos difieren. El valor p para esta prueba es 0,002.

Después de realizar la prueba F , es común llevar a cabo un análisis "post hoc" de las medias de los grupos. En este caso, las dos primeras medias de los grupos difieren en 4 unidades, la primera y la tercera medias de los grupos difieren en 5 unidades, y la segunda y la tercera medias de los grupos difieren en solo 1 unidad. El error estándar de cada una de estas diferencias es4.5/6+4.5/6=1.2{\displaystyle {\sqrt {4.5/6+4.5/6}}=1.2}Por lo tanto, el primer grupo se diferencia notablemente de los demás, ya que la diferencia media es más de tres veces el error estándar. Esto nos permite afirmar con alta certeza que la media poblacional del primer grupo difiere de las medias poblacionales de los otros grupos. Sin embargo, no hay evidencia de que el segundo y el tercer grupo tengan medias poblacionales diferentes entre sí, dado que su diferencia media de una unidad es comparable al error estándar.

Nótese que F ( x , y ) denota una función de distribución acumulativa de distribución F con x grados de libertad en el numerador e y grados de libertad en el denominador. 

Véase también

Notas

  1. 1 2 Howell, David (2002). Métodos estadísticos para la psicología . Duxbury. págs. 324–325 . ISBN  0-534-37770-X.
  2. Welch, BL (1951). "Sobre la comparación de varios valores medios: un enfoque alternativo". Biometrika . 38 (3/4): 330– 336. doi : 10.2307/2332579 . JSTOR 2332579 . 
  3. Kirk, RE (1995). Diseño experimental: procedimientos para las ciencias del comportamiento (3.ª ed.). Pacific Grove, CA, EE. UU.: Brooks/Cole. 
  4. Blair, RC (1981). "Una reacción a 'Consecuencias del incumplimiento de los supuestos subyacentes al análisis de varianza y covarianza de efectos fijos'".". Revista de Investigación Educativa . 51 (4): 499– 507. doi : 10.3102/00346543051004499 .
  5. Randolf, EA; Barcikowski, RS (1989). "Tasa de error de tipo I cuando se utilizan valores de estudios reales como parámetros poblacionales en un estudio de Monte Carlo". Ponencia presentada en la 11.ª Reunión Anual de la Asociación de Investigación Educativa del Medio Oeste, Chicago .
  6. Donaldson, Theodore S. (1966). "Potencia de la prueba F para distribuciones no normales y varianzas de error desiguales" . Documento preparado para el proyecto RAND de la Fuerza Aérea de los Estados Unidos .
  7. Tiku, ML (1971). "Función de potencia de la prueba F en situaciones no normales". Journal of the American Statistical Association . 66 (336): 913– 916. doi : 10.1080/01621459.1971.10482371 .
  8. "Introducción a los conceptos de estadística" . Archivado del original el 4 de diciembre de 2018. Consultado el 22 de septiembre de 2016 .
  9. Sawilowsky, S. (1990). "Pruebas no paramétricas de interacción en el diseño experimental". Review of Educational Research . 60 (1): 91– 126. doi : 10.3102/00346543060001091 .
  10. Montgomery, Douglas C. (2001). Diseño y análisis de experimentos (5.ª ed.). Nueva York: Wiley. pág. Sección 3–2. ISBN   9780471316497.
  11. Moore, David S.; McCabe , George P. (2003). Introducción a la práctica de la estadística (4.ª ed.). WH Freeman & Co. pág. 764. ISBN   0716796570.
  12. Winkler, Robert L.; Hays, William L. (1975). Estadística: Probabilidad, inferencia y decisión (2.ª ed.). Nueva York: Holt, Rinehart and Winston. p. 761 .  

Lecturas adicionales