En estadística , el análisis de varianza unidireccional (o ANOVA unidireccional ) es una técnica para comparar si las medias de dos o más muestras son significativamente diferentes (utilizando la distribución F ). Esta técnica de análisis de varianza requiere una variable de respuesta numérica "Y" y una única variable explicativa "X", de ahí el nombre "unidireccional". [ 1 ]
El ANOVA pone a prueba la hipótesis nula , que establece que las muestras de todos los grupos provienen de poblaciones con los mismos valores medios. Para ello, se realizan dos estimaciones de la varianza poblacional. Estas estimaciones se basan en diversas suposiciones ( véase más adelante ). El ANOVA produce un estadístico F, que es la razón entre la varianza calculada entre las medias y la varianza dentro de las muestras. Si las medias de los grupos provienen de poblaciones con los mismos valores medios, la varianza entre las medias de los grupos debería ser menor que la varianza de las muestras, según el teorema del límite central . Por lo tanto, una razón mayor implica que las muestras provienen de poblaciones con diferentes valores medios. [ 1 ]
Normalmente, sin embargo, el ANOVA unidireccional se utiliza para comprobar las diferencias entre al menos tres grupos, ya que el caso de dos grupos puede cubrirse con una prueba t (Gosset, 1908). Cuando solo hay dos medias que comparar, la prueba t y la prueba F son equivalentes; la relación entre ANOVA y t viene dada por F = t² . Una extensión del ANOVA unidireccional es el análisis de varianza bidireccional , que examina la influencia de dos variables independientes categóricas diferentes sobre una variable dependiente.
Supuestos
Los resultados de un ANOVA unidireccional pueden considerarse fiables siempre que se cumplan los siguientes supuestos:
- Los residuos de la variable de respuesta siguen una distribución normal (o aproximadamente normal).
- Las varianzas de las poblaciones son iguales.
- Las respuestas de un grupo determinado son variables aleatorias normales , independientes e idénticamente distribuidas (no una muestra aleatoria simple (MAS)).
Las principales variantes son: Si los datos son ordinales , se debe utilizar una alternativa no paramétrica a esta prueba, como el análisis de varianza unidireccional de Kruskal-Wallis . Si no se sabe si las varianzas son iguales, se puede utilizar una generalización de la prueba t de Welch para dos muestras . [ 2 ]
Desviaciones de la normalidad poblacional
ANOVA es un procedimiento relativamente robusto con respecto a las violaciones del supuesto de normalidad. [ 3 ]
El ANOVA unidireccional se puede generalizar a los diseños factoriales y multivariados, así como al análisis de covarianza .
En la literatura popular se suele afirmar que ninguna de estas pruebas F es robusta cuando existen violaciones graves del supuesto de que cada población sigue una distribución normal , especialmente para niveles alfa pequeños y diseños desequilibrados. [ 4 ] Además, también se afirma que si se viola el supuesto subyacente de homocedasticidad , las propiedades del error de tipo I se deterioran mucho más gravemente. [ 5 ]
Sin embargo, esto es una idea errónea, basada en trabajos realizados en la década de 1950 y anteriores. La primera investigación exhaustiva del tema mediante simulación de Monte Carlo fue realizada por Donaldson (1966). [ 6 ] Demostró que bajo las desviaciones habituales (asimetría positiva, varianzas desiguales) "la prueba F es conservadora", y por lo tanto es menos probable de lo que debería ser encontrar que una variable es significativa. Sin embargo, a medida que aumenta el tamaño de la muestra o el número de celdas, "las curvas de potencia parecen converger a la basada en la distribución normal". Tiku (1971) encontró que "la potencia de la teoría no normal de F difiere de la potencia de la teoría normal por un término de corrección que disminuye drásticamente con el aumento del tamaño de la muestra". [ 7 ] El problema de la no normalidad, especialmente en muestras grandes, es mucho menos grave de lo que sugieren los artículos populares.
La opinión actual es que "los estudios de Montecarlo se utilizaron ampliamente con pruebas basadas en la distribución normal para determinar su sensibilidad a las violaciones del supuesto de distribución normal de las variables analizadas en la población. La conclusión general de estos estudios es que las consecuencias de tales violaciones son menos graves de lo que se pensaba anteriormente. Si bien estas conclusiones no deberían desalentar por completo la preocupación por el supuesto de normalidad, han aumentado la popularidad general de las pruebas estadísticas dependientes de la distribución en todas las áreas de investigación". [ 8 ]
Para alternativas no paramétricas en el diseño factorial, véase Sawilowsky. [ 9 ] Para más información, véase ANOVA sobre rangos .
El caso de efectos fijos, experimento totalmente aleatorio, datos desequilibrados
El modelo
El modelo lineal normal describe grupos de tratamiento con distribuciones de probabilidad que son curvas normales (en forma de campana) idénticas, pero con medias diferentes. Por lo tanto, para ajustar los modelos solo se requieren las medias de cada grupo de tratamiento y el cálculo de la varianza (se utiliza la varianza promedio dentro de los grupos de tratamiento). Los cálculos de las medias y la varianza se realizan como parte de la prueba de hipótesis.
Los modelos lineales normales comúnmente utilizados para un experimento completamente aleatorio son: [ 10 ]
- (el modelo de medios)
o
- (el modelo de efectos)
dónde
- es un índice sobre unidades experimentales
- es un índice sobre los grupos de tratamiento
- es el número de unidades experimentales en el j-ésimo grupo de tratamiento
- es el número total de unidades experimentales
- son observaciones
- es la media de las observaciones para el j-ésimo grupo de tratamiento
- es la media general de las observaciones
- es el j-ésimo efecto del tratamiento, una desviación de la media general
- ,son errores aleatorios con media cero y distribución normal.
El índiceLas unidades experimentales pueden interpretarse de varias maneras. En algunos experimentos, la misma unidad experimental está sujeta a una gama de tratamientos;puede señalar una unidad en particular. En otros casos, cada grupo de tratamiento tiene un conjunto distinto de unidades experimentales;puede ser simplemente un índice en el-lista.
Los datos y los resúmenes estadísticos de los datos
Una forma de organizar las observaciones experimentales está con grupos en columnas:
Comparación del modelo con los resúmenes:yLa media general y la varianza general se calculan a partir de las sumas generales, no a partir de las medias y varianzas de los grupos.
La prueba de hipótesis
A partir de las estadísticas descriptivas , los cálculos de la prueba de hipótesis se muestran en forma tabular. Si bien se muestran dos columnas de SS para su valor explicativo, solo se requiere una columna para mostrar los resultados.
es la estimación de la varianza correspondiente adel modelo.
Resumen del análisis
El análisis ANOVA central consiste en una serie de cálculos. Los datos se recopilan en forma tabular. Luego
- Cada grupo de tratamiento se resume mediante el número de unidades experimentales, dos sumas, una media y una varianza. Los resúmenes de los grupos de tratamiento se combinan para obtener los totales del número de unidades y las sumas. La media general y la varianza general se calculan a partir de las sumas generales. Las medias de los tratamientos y las medias generales se utilizan en el modelo.
- Los tres DF y SS se calculan a partir de los resúmenes. Luego se calculan los MS y una razón determina F.
- Normalmente, un ordenador calcula un valor p a partir de F, que determina si los tratamientos producen resultados significativamente diferentes. Si el resultado es significativo, el modelo tiene validez provisional.
Si el experimento está equilibrado, todos losLos términos son iguales, por lo que las ecuaciones SS se simplifican.
En un experimento más complejo, donde las unidades experimentales (o efectos ambientales) no son homogéneas, también se utilizan estadísticas de fila en el análisis. El modelo incluye términos que dependen de Determinar los términos adicionales reduce el número de grados de libertad disponibles.
Ejemplo
Consideremos un experimento para estudiar el efecto de tres niveles diferentes de un factor sobre una respuesta (por ejemplo, tres niveles de fertilizante sobre el crecimiento de las plantas). Si tuviéramos 6 observaciones para cada nivel, podríamos escribir el resultado del experimento en una tabla como esta, donde a₁, a₂ y a₃ son los tres niveles del factor estudiado.
La hipótesis nula, denotada H₀ , para la prueba F general de este experimento sería que los tres niveles del factor producen la misma respuesta, en promedio. Para calcular la razón F :
Paso 1: Calcular la media dentro de cada grupo:
Paso 2: Calcular la media general:
- donde a es el número de grupos.
Paso 3: Calcular la suma de las diferencias al cuadrado "entre grupos":
donde n es el número de valores de datos por grupo.
Los grados de libertad entre grupos son uno menos que el número de grupos.
por lo que el valor cuadrático medio entre grupos es
Paso 4: Calcular la suma de cuadrados "dentro del grupo". Comience por centrar los datos en cada grupo.
La suma de cuadrados dentro del grupo es la suma de cuadrados de los 18 valores de esta tabla.
Los grados de libertad dentro del grupo son
Por lo tanto, el valor cuadrático medio dentro del grupo es
Paso 5: La razón F es
El valor crítico es el número que el estadístico de prueba debe superar para rechazar la prueba. En este caso, F crit (2,15) = 3,68 con α = 0,05. Dado que F = 9,3 > 3,68, los resultados son significativos al nivel de significancia del 5 %. No se aceptaría la hipótesis nula, concluyendo que existe evidencia sólida de que los valores esperados en los tres grupos difieren. El valor p para esta prueba es 0,002.
Después de realizar la prueba F , es común llevar a cabo un análisis "post hoc" de las medias de los grupos. En este caso, las dos primeras medias de los grupos difieren en 4 unidades, la primera y la tercera medias de los grupos difieren en 5 unidades, y la segunda y la tercera medias de los grupos difieren en solo 1 unidad. El error estándar de cada una de estas diferencias esPor lo tanto, el primer grupo se diferencia notablemente de los demás, ya que la diferencia media es más de tres veces el error estándar. Esto nos permite afirmar con alta certeza que la media poblacional del primer grupo difiere de las medias poblacionales de los otros grupos. Sin embargo, no hay evidencia de que el segundo y el tercer grupo tengan medias poblacionales diferentes entre sí, dado que su diferencia media de una unidad es comparable al error estándar.
Nótese que F ( x , y ) denota una función de distribución acumulativa de distribución F con x grados de libertad en el numerador e y grados de libertad en el denominador.
Véase también
- Análisis de varianza
- Prueba F ( incluye un ejemplo de ANOVA unidireccional )
- Modelo mixto
- Análisis multivariado de varianza (MANOVA)
- ANOVA de medidas repetidas
- ANOVA bidireccional
- Prueba t de Welch
Notas
- 1 2 Howell, David (2002). Métodos estadísticos para la psicología . Duxbury. págs. 324–325 . ISBN 0-534-37770-X.
- ↑ Welch, BL (1951). "Sobre la comparación de varios valores medios: un enfoque alternativo". Biometrika . 38 (3/4): 330– 336. doi : 10.2307/2332579 . JSTOR 2332579 .
- ↑ Kirk, RE (1995). Diseño experimental: procedimientos para las ciencias del comportamiento (3.ª ed.). Pacific Grove, CA, EE. UU.: Brooks/Cole.
- ↑ Blair, RC (1981). "Una reacción a 'Consecuencias del incumplimiento de los supuestos subyacentes al análisis de varianza y covarianza de efectos fijos'".". Revista de Investigación Educativa . 51 (4): 499– 507. doi : 10.3102/00346543051004499 .
- ↑ Randolf, EA; Barcikowski, RS (1989). "Tasa de error de tipo I cuando se utilizan valores de estudios reales como parámetros poblacionales en un estudio de Monte Carlo". Ponencia presentada en la 11.ª Reunión Anual de la Asociación de Investigación Educativa del Medio Oeste, Chicago .
- ↑ Donaldson, Theodore S. (1966). "Potencia de la prueba F para distribuciones no normales y varianzas de error desiguales" . Documento preparado para el proyecto RAND de la Fuerza Aérea de los Estados Unidos .
- ↑ Tiku, ML (1971). "Función de potencia de la prueba F en situaciones no normales". Journal of the American Statistical Association . 66 (336): 913– 916. doi : 10.1080/01621459.1971.10482371 .
- ↑ "Introducción a los conceptos de estadística" . Archivado del original el 4 de diciembre de 2018. Consultado el 22 de septiembre de 2016 .
- ↑ Sawilowsky, S. (1990). "Pruebas no paramétricas de interacción en el diseño experimental". Review of Educational Research . 60 (1): 91– 126. doi : 10.3102/00346543060001091 .
- ↑ Montgomery, Douglas C. (2001). Diseño y análisis de experimentos (5.ª ed.). Nueva York: Wiley. pág. Sección 3–2. ISBN 9780471316497.
- ↑ Moore, David S.; McCabe , George P. (2003). Introducción a la práctica de la estadística (4.ª ed.). WH Freeman & Co. pág. 764. ISBN 0716796570.
- ↑ Winkler, Robert L.; Hays, William L. (1975). Estadística: Probabilidad, inferencia y decisión (2.ª ed.). Nueva York: Holt, Rinehart and Winston. p. 761 .
Lecturas adicionales
- George Casella (18 de abril de 2008). Diseño estadístico . Springer . ISBN 978-0-387-75965-4.
- Análisis de varianza
- Pruebas estadísticas