Articulo de referencia

Cuadrados medios esperados

En estadística , las medias cuadráticas esperadas (MCE) son los valores esperados de ciertas estadísticas que surgen de particiones de sumas de cuadrados en el análisis de varia...

En estadística , las medias cuadráticas esperadas (MCE) son los valores esperados de ciertas estadísticas que surgen de particiones de sumas de cuadrados en el análisis de varianza (ANOVA). Se pueden usar para determinar qué estadística debe aparecer en el denominador de una prueba F para contrastar la hipótesis nula de que un efecto particular está ausente.

Definición

Cuando la suma total corregida de cuadrados en un ANOVA se divide en varios componentes, cada uno atribuido al efecto de una variable predictora particular, cada una de las sumas de cuadrados en esa partición es una variable aleatoria con un valor esperado . Ese valor esperado dividido por el número correspondiente de grados de libertad es el cuadrado medio esperado para esa variable predictora.

Ejemplo

El siguiente ejemplo proviene de Análisis de datos longitudinales de Donald Hedeker y Robert D. Gibbons . [ 1 ]

Cada uno de los s tratamientos (uno de los cuales puede ser un placebo) se administra a una muestra de N pacientes elegidos al azar, en quienes se realizan ciertas mediciones.Yhij{\textstyle Y_{hij}}se observan en cada uno de los n momentos especificados, parah=1,,s,i=1,,norteh{\textstyle h=1,\ldots ,s,\quad i=1,\ldots ,N_{h}}(por lo tanto, el número de pacientes que reciben diferentes tratamientos puede variar), yj=1,,norte.{\textstyle j=1,\ldots ,n.}Suponemos que los conjuntos de pacientes que reciben diferentes tratamientos son disjuntos, por lo que los pacientes están anidados dentro de los tratamientos y no se cruzan con los tratamientos. Tenemos

Yhij=μ+γh+τj+(γτ)hj+πi(h)+εhij{\displaystyle Y_{hij}=\mu +\gamma _{h}+\tau _{j}+(\gamma \tau )_{hj}+\pi _{i(h)}+\varepsilon _{hij}}

dónde

  • μ{\displaystyle \mu }= media general , (fija)
  • γh{\displaystyle \gamma _{h}}= efecto del tratamientoh{\displaystyle h}, (fijado)
  • τj{\displaystyle \tau _{j}}= efecto del tiempoj{\displaystyle j}, (fijado)
  • (γτ)hj{\displaystyle (\gamma \tau )_{hj}}= efecto de interacción del tratamientoh{\displaystyle h}y tiempoj{\displaystyle j}, (fijado)
  • πi(h){\displaystyle \pi _{i(h)}}= efecto de diferencia individual para el pacientei{\displaystyle i}anidado dentro del tratamientoh{\displaystyle h}, (aleatorio)
  • εhij{\displaystyle \varepsilon _{hij}}= error para el pacientei{\displaystyle i}en tratamientoh{\displaystyle h}en ese momentoj{\displaystyle j}. (aleatorio)
  • σπ2{\displaystyle \sigma _{\pi }^{2}}= varianza del efecto aleatorio de los pacientes anidados dentro de los tratamientos,
  • σε{\displaystyle \sigma _{\varepsilon }}= varianza del error.

La suma total corregida de cuadrados es

hij(YhijY¯)2dónde Y¯=1nortehijYhij.{\displaystyle \sum _{hij}(Y_{hij}-{\overline {Y}})^{2}\quad {\text{donde }}{\overline {Y}}={\frac {1}{n}}\sum _{hij}Y_{hij}.}

La tabla ANOVA que se muestra a continuación divide la suma de cuadrados (dondenorte=hnorteh{\textstyle N=\sum _{h}N_{h}}):

Uso en pruebas F

Una hipótesis nula de interés es que no hay diferencia entre los efectos de los diferentes tratamientos, por lo tanto, no hay diferencia entre las medias de los tratamientos. Esto se puede expresar diciendo:DTran=0,{\textstyle D_{\text{Tr}}=0,}(con la notación utilizada en la tabla anterior). Bajo esta hipótesis nula, el cuadrado medio esperado para los efectos de los tratamientos esσε2+norteσπ2.{\textstyle \sigma _{\varepsilon }^{2}+n\sigma _{\pi }^{2}.}

El numerador en el estadístico F para probar esta hipótesis es el cuadrado medio debido a las diferencias entre tratamientos, es decir,  esSSTran/(s1).{\textstyle \left.{\text{SS}}_{\text{Tr}}\right/(s-1).}El denominador, sin embargo, no esSSmi/((nortes)(norte1)).{\textstyle \left.{\text{SS}}_{\text{E}}\right/{\big (}(N-s)(n-1){\big )}.}La razón es que la variable aleatoria que se muestra a continuación, aunque bajo la hipótesis nula tiene una distribución F , no es observable —no es una estadística— porque su valor depende de parámetros no observables.σπ2{\textstyle \sigma _{\pi }^{2}}yσε2.{\textstyle \sigma _{\varepsilon }^{2}.}

SSTranσε2+norteσπ2/(s1)SSmiσε2/((nortes)(norte1))SSTran/(s1)SSmi/((nortes)(norte1)){\displaystyle {\frac {\left.{\frac {{\text{SS}}_{\text{Tr}}}{\sigma _{\varepsilon }^{2}+n\sigma _{\pi }^{2}}}\right/(s-1)}{\left.{\frac {{\text{SS}}_{\text{E}}}{\sigma _{\varepsilon }^{2}}}\right/{\big (}(N-s)(n-1){\big )}}}\neq {\frac {{\text{SS}}_{\text{Tr}}/(s-1)}{{\text{SS}}_{\text{E}}/{\big (}(N-s)(n-1){\big )}}}}

En cambio, se utiliza como estadístico de prueba la siguiente variable aleatoria que no está definida en términos deSSmi{\textstyle {\text{SS}}_{\text{E}}}:

F=SSTranσε2+norteσπ2/(s1)SSS(Tran)σε2+norteσπ2/(nortes)=SSTran/(s1)SSS(Tr)/(nortes){\displaystyle F={\frac {\left.{\frac {{\text{SS}}_{\text{Tr}}}{\sigma _{\varepsilon }^{2}+n\sigma _{\pi }^{2}}}\right/(s-1)}{\left.{\frac {{\text{SS}}_{{\text{S}}({\text{Tr}})}}{\sigma _{\varepsilon }^{2}+n\sigma _{\pi }^{2}}}\right/(N-s)}}={\frac {\left.{\text{SS}}_{\text{Tr}}\right/(s-1)}{\left.{\text{SS}}_{\text{S(Tr)}}\right/(N-s)}}}

Notas y referencias

  1. Donald Hedeker, Robert D. Gibbons. Análisis de datos longitudinales. Wiley Interscience. 2006. págs. 21–24