Articulo de referencia

Desviaciones cuadráticas respecto a la media

Las desviaciones cuadráticas respecto a la media ( DCM ) resultan de elevar al cuadrado las desviaciones . En teoría de la probabilidad y estadística , la definición de varianza...

Las desviaciones cuadráticas respecto a la media ( DCM ) resultan de elevar al cuadrado las desviaciones . En teoría de la probabilidad y estadística , la definición de varianza es el valor esperado de la DCM (cuando se considera una distribución teórica ) o su valor promedio (para datos experimentales reales). Los cálculos para el análisis de varianza implican la partición de una suma de DCM.

Fondo

La comprensión de los cálculos involucrados se ve enormemente mejorada por un estudio del valor estadístico.

mi(incógnita2){\displaystyle \operatorname {E} (X^{2})}, dóndemi{\displaystyle \operatorname {E} }es el operador de valor esperado.

Para una variable aleatoriaincógnita{\displaystyle X}con significaμ{\displaystyle \mu }y varianzaσ2{\displaystyle \sigma ^{2}},

σ2=mi(incógnita2)μ2.{\displaystyle \sigma ^{2}=\operatorname {E} (X^{2})-\mu ^{2}.}[ 1 ]

(Su derivación se muestra aquí .) Por lo tanto,

mi(incógnita2)=σ2+μ2.{\displaystyle \operatorname {E} (X^{2})=\sigma ^{2}+\mu ^{2}.}

De lo anterior se puede deducir lo siguiente:

mi((incógnita2))=norteσ2+norteμ2,{\displaystyle \operatorname {E} \left(\sum \left(X^{2}\right)\right)=n\sigma ^{2}+n\mu ^{2},}
mi((incógnita)2)=norteσ2+norte2μ2.{\displaystyle \operatorname {E} \left(\left(\sum X\right)^{2}\right)=n\sigma ^{2}+n^{2}\mu ^{2}.}

Varianza de la muestra

La suma de las desviaciones al cuadrado necesarias para calcular la varianza de la muestra (antes de decidir si dividir por n o por n 1) se calcula más fácilmente como   S=incógnita2(incógnita)2norte.{\displaystyle S=\sum x^{2}-{\frac {\left(\sum x\right)^{2}}{n}}.}

A partir de las dos expectativas derivadas anteriormente, el valor esperado de esta suma es mi(S)=norteσ2+norteμ2norteσ2+norte2μ2norte,{\displaystyle \operatorname {E} (S)=n\sigma ^{2}+n\mu ^{2}-{\frac {n\sigma ^{2}+n^{2}\mu ^{2}}{n}},} lo cual implica mi(S)=(norte1)σ2.{\displaystyle \operatorname {E} (S)=(n-1)\sigma ^{2}.}

Esto demuestra de manera efectiva el uso del divisor n 1 en el cálculo de una estimación de muestra insesgada de σ 2 .   

Partición análisis de varianza

En la situación en la que se dispone de datos para k grupos de tratamiento diferentes de tamaño n i donde i varía de 1 a k , entonces se supone que la media esperada de cada grupo es

mi(μi)=μ+Ti{\displaystyle \operatorname {E} (\mu _{i})=\mu +T_{i}}

y la varianza de cada grupo de tratamiento no cambia con respecto a la varianza de la población.σ2{\displaystyle \sigma ^{2}}.

Bajo la hipótesis nula de que los tratamientos no tienen efecto, entonces cada uno de losTi{\displaystyle T_{i}}será cero.

Ahora es posible calcular tres sumas de cuadrados:

Individual
I=incógnita2{\displaystyle I=\sum x^{2}}
mi(I)=norteσ2+norteμ2{\displaystyle \operatorname {E} (I)=n\sigma ^{2}+n\mu ^{2}}
Tratos
T=i=1k((incógnita)2/nortei){\displaystyle T=\sum _{i=1}^{k}\left(\left(\sum x\right)^{2}/n_{i}\right)}
mi(T)=kσ2+i=1knortei(μ+Ti)2{\displaystyle \operatorname {E} (T)=k\sigma ^{2}+\sum _{i=1}^{k}n_{i}(\mu +T_{i})^{2}}
mi(T)=kσ2+norteμ2+2μi=1k(norteiTi)+i=1knortei(Ti)2{\displaystyle \operatorname {E} (T)=k\sigma ^{2}+n\mu ^{2}+2\mu \sum _{i=1}^{k}(n_{i}T_{i})+\sum _{i=1}^{k}n_{i}(T_{i})^{2}}

Bajo la hipótesis nula de que los tratamientos no causan diferencias y todos losTi{\displaystyle T_{i}}son cero, la expectativa se simplifica a

mi(T)=kσ2+norteμ2.{\displaystyle \operatorname {E} (T)=k\sigma ^{2}+n\mu ^{2}.}
Combinación
do=(incógnita)2/norte{\displaystyle C=\left(\sum x\right)^{2}/n}
mi(do)=σ2+norteμ2{\displaystyle \operatorname {E} (C)=\sigma ^{2}+n\mu ^{2}}

Suma de desviaciones al cuadrado

Bajo la hipótesis nula, la diferencia de cualquier par de I , T y C no contiene ninguna dependencia deμ{\displaystyle \mu }, soloσ2{\displaystyle \sigma ^{2}}.

mi(Ido)=(norte1)σ2{\displaystyle \operatorname {E} (I-C)=(n-1)\sigma ^{2}}desviaciones cuadráticas totales también conocidas como suma total de cuadrados
mi(Tdo)=(k1)σ2{\displaystyle \operatorname {E} (T-C)=(k-1)\sigma ^{2}}desviaciones al cuadrado del tratamiento también conocidas como suma de cuadrados explicada
mi(IT)=(nortek)σ2{\displaystyle \operatorname {E} (I-T)=(n-k)\sigma ^{2}}desviaciones cuadráticas residuales también conocidas como suma de cuadrados residuales

Las constantes ( n 1), ( k 1) y ( n k ) se conocen normalmente como el número de grados de libertad .      

Ejemplo

En un ejemplo muy sencillo, se obtienen 5 observaciones a partir de dos tratamientos. El primer tratamiento da tres valores: 1, 2 y 3, y el segundo tratamiento da dos valores: 4 y 6.

I=121+221+321+421+621=66{\displaystyle I={\frac {1^{2}}{1}}+{\frac {2^{2}}{1}}+{\frac {3^{2}}{1}}+{\frac {4^{2}}{1}}+{\frac {6^{2}}{1}}=66}
T=(1+2+3)23+(4+6)22=12+50=62{\displaystyle T={\frac {(1+2+3)^{2}}{3}}+{\frac {(4+6)^{2}}{2}}=12+50=62}
do=(1+2+3+4+6)25=256/5=51.2{\displaystyle C={\frac {(1+2+3+4+6)^{2}}{5}}=256/5=51.2}

Donación

Desviaciones cuadráticas totales = 66 51,2 = 14,8 con 4 grados de libertad.
Desviaciones cuadradas del tratamiento = 62 51,2 = 10,8 con 1 grado de libertad.
Desviaciones cuadráticas residuales = 66 62 = 4 con 3 grados de libertad.

Análisis de varianza bidireccional

En estadística , el análisis de varianza bidireccional (ANOVA) se utiliza para estudiar cómo dos variables independientes categóricas afectan a una variable dependiente continua . [ 2 ] Extiende el análisis de varianza unidireccional (ANOVA unidireccional) al permitir que ambos factores se analicen simultáneamente. Un ANOVA bidireccional evalúa el efecto principal de cada variable independiente y si existe alguna interacción entre ellas. [ 2 ]

Los investigadores utilizan esta prueba para determinar si dos factores actúan de forma independiente o combinada para influir en una variable dependiente . Se utiliza en los campos de la psicología , la agricultura , la educación y la investigación biomédica . [ 3 ] Por ejemplo, se puede utilizar para estudiar cómo el tipo de fertilizante y el nivel de agua afectan conjuntamente el crecimiento de las plantas. El análisis produce estadísticos F que indican si las diferencias observadas entre grupos son estadísticamente significativas. [ 4 ] [ 3 ]

Véase también

Referencias

  1. Mood y Graybill: Introducción a la teoría de la estadística (McGraw Hill)
  2. 1 2 Kim, Hae-Young (2014-03-21). "Notas estadísticas para investigadores clínicos: análisis de varianza bidireccional (ANOVA): exploración de la posible interacción entre factores" . Odontología Restauradora y Endodoncia . 39 (2): 143– 147. doi : 10.5395/rde.2014.39.2.143 . ISSN 2234-7658 . PMC 3978106. PMID 24790929 .   
  3. 1 2 Gelman, Andrew (febrero de 2005). "¿Análisis de varianza? Por qué es más importante que nunca". The Annals of Statistics . 33 (1): 1– 53. arXiv : math/0504499 . doi : 10.1214/009053604000001048 . S2CID 125025956 . 
  4. Fujikoshi, Yasunori (1993). "Modelos ANOVA bidireccionales con datos desequilibrados" . Matemáticas Discretas . 116 (1): 315– 334. doi : 10.1016/0012-365X(93)90410-U .