Articulo de referencia

Distribución T al cuadrado de Hotelling

2 distribution"},"1":{"wt":"\n"},"type":{"wt":"density"},"2":{"wt":"\n"},"pdf_image":{"wt":"[[Image:Hotelling-pdf.png|325px]]"},"3":{"wt":"\n"},"cdf_image":{"wt":"[[Image:Hotell...

En estadística , particularmente en pruebas de hipótesis , la distribución T al cuadrado de Hotelling ( ), propuesta por Harold Hotelling , [ 1 ] es una distribución de probabilidad multivariante estrechamente relacionada con la distribución F y destaca por surgir como la distribución de un conjunto de estadísticos muestrales que son generalizaciones naturales de los estadísticos subyacentes a la distribución t de Student . El estadístico t al cuadrado de Hotelling ( ) es una generalización del estadístico t de Student que se utiliza en pruebas de hipótesis multivariantes . [ 2 ]

Motivación

La distribución surge en estadística multivariante al realizar pruebas de diferencias entre las medias (multivariantes) de diferentes poblaciones, mientras que las pruebas para problemas univariantes utilizarían una prueba t . La distribución recibe su nombre de Harold Hotelling , quien la desarrolló como una generalización de la distribución t de Student . [ 1 ]

Definición

Si el vector d{\displaystyle d} es una distribución multivariada gaussiana con media cero y matriz de covarianza unitarianorte(0pag,Ipag,pag){\displaystyle N(\mathbf {0} _{p},\mathbf {I} _{p,p})}yMETRO{\displaystyle M}es unpag×pag{\displaystyle p\times p}matriz aleatoria con una distribución de WishartW(Ipag,pag,metro){\displaystyle W(\mathbf {I} _{p,p},m)}con una matriz de escala unitaria y m grados de libertad , y d y M son independientes entre sí, entonces la forma cuadráticaincógnita{\displaystyle X}tiene una distribución de Hotelling (con parámetrospag{\displaystyle p}ymetro{\displaystyle m}): [ 3 ]incógnita=metrodTMETRO1dT2(pag,metro).{\displaystyle X=md^{T}M^{-1}d\sim T^{2}(p,m).}

Se puede demostrar que si una variable aleatoria X tiene la distribución T al cuadrado de Hotelling ,incógnitaTpag,metro2{\displaystyle X\sim T_{p,m}^{2}}, entonces: [ 1 ]metropag+1pagmetroincógnitaFpag,metropag+1{\displaystyle {\frac {m-p+1}{pm}}X\sim F_{p,m-p+1}} dóndeFpag,metropag+1{\displaystyle F_{p,m-p+1}}es la distribución F con parámetros p y m p + 1.    

Estadístico t -cuadrado de Hotelling

DejarΣ^{\displaystyle {\hat {\mathbf {\Sigma } }}}sea ​​la covarianza de la muestra :

Σ^=1norte1i=1norte(incógnitaiincógnita¯)(incógnitaiincógnita¯){\displaystyle {\hat {\mathbf {\Sigma } }}={\frac {1}{n-1}}\sum _{i=1}^{n}\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)'}

donde denotamos la transposición con un apóstrofo . Se puede demostrar queΣ^{\displaystyle {\hat {\mathbf {\Sigma } }}}es una matriz (semi)definida positiva y(norte1)Σ^{\displaystyle (n-1){\hat {\mathbf {\Sigma } }}}sigue una distribución de Wishart p -variada con n − 1 grados de libertad. [ 4 ] La matriz de covarianza muestral de la media es:  Σ^incógnita¯=Σ^/norte{\displaystyle {\hat {\mathbf {\Sigma } }}_{\overline {\mathbf {x} }}={\hat {\mathbf {\Sigma } }}/n}. [ 5 ]

El estadístico t -cuadrado de Hotelling se define entonces como: [ 6 ]

t2=(incógnita¯μ)Σ^incógnita¯1(incógnita¯μ)=norte(incógnita¯μ)Σ^1(incógnita¯μ),{\displaystyle t^{2}=({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\hat {\mathbf {\Sigma } }}_{\overline {\mathbf {x} }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }})=n({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\hat {\mathbf {\Sigma } }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }}),}

que es proporcional a la distancia de Mahalanobis entre la media de la muestra yμ{\displaystyle {\boldsymbol {\mu }}}. Por este motivo, cabe esperar que la estadística tome valores bajos siincógnita¯μ{\displaystyle {\overline {\mathbf {x} }}\approx {\boldsymbol {\mu }}}y valores altos si son diferentes.

De la distribución ,

t2Tpag,norte12=pag(norte1)nortepagFpag,nortepag,{\displaystyle t^{2}\sim T_{p,n-1}^{2}={\frac {p(n-1)}{np}}F_{p,np},}

dóndeFpag,nortepag{\displaystyle F_{p,np}}es la distribución F con parámetros p y n p . 

Para calcular un valor p (no relacionado con la variable p aquí), tenga en cuenta que la distribución det2{\displaystyle t^{2}}equivalentemente implica que

nortepagpag(norte1)t2Fpag,nortepag.{\displaystyle {\frac {np}{p(n-1)}}t^{2}\sim F_{p,np}.}

Luego, utilice la cantidad del lado izquierdo para evaluar el valor p correspondiente a la muestra, que proviene de la distribución F. También se puede determinar una región de confianza mediante una lógica similar.

Motivación

Dejarnortepag(μ,Σ){\displaystyle {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}denota una distribución normal p -variada con ubicaciónμ{\displaystyle {\boldsymbol {\mu }}}y covarianza conocidaΣ{\displaystyle {\mathbf {\Sigma } }}. Dejar

incógnita1,,incógnitanortenortepag(μ,Σ){\displaystyle {\mathbf {x} }_{1},\dots,{\mathbf {x} }_{n}\sim {\mathcal {N}}_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}

sean n variables aleatorias independientes e idénticamente distribuidas (iid) , que pueden representarse comopag×1{\displaystyle p\times 1}Vectores columna de números reales. Definir

incógnita¯=incógnita1++incógnitanortenorte{\displaystyle {\overline {\mathbf {x} }}={\frac {\mathbf {x} _{1}+\cdots +\mathbf {x} _{n}}{n}}}

ser la media muestral con covarianzaΣincógnita¯=Σ/norte{\displaystyle {\mathbf {\Sigma } }_{\overline {\mathbf {x} }}={\mathbf {\Sigma } }/n}Se puede demostrar que

(incógnita¯μ)Σincógnita¯1(incógnita¯μ)χpag2,{\displaystyle ({\overline {\mathbf {x} }}-{\boldsymbol {\mu }})'{\mathbf {\Sigma } }_{\overline {\mathbf {x} }}^{-1}({\overline {\mathbf {x} }}-{\boldsymbol {\mathbf {\mu } }})\sim \chi _{p}^{2},}

dóndeχpag2{\displaystyle \chi _{p}^{2}}es la distribución chi-cuadrado con p grados de libertad. [ 7 ]

Alternativamente, se puede argumentar utilizando funciones de densidad y funciones características, como sigue.

Estadístico de dos muestras

Siincógnita1,,incógnitanorteincógnitanortepag(μ,Σ){\displaystyle {\mathbf {x} }_{1},\dots ,{\mathbf {x} }_{n_{x}}\sim N_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}yy1,,ynorteynortepag(μ,Σ){\displaystyle {\mathbf {y} }_{1},\dots ,{\mathbf {y} }_{n_{y}}\sim N_{p}({\boldsymbol {\mu }},{\mathbf {\Sigma } })}, con las muestras extraídas independientemente de dos distribuciones normales multivariadas independientes con la misma media y covarianza, y definimos

incógnita¯=1norteincógnitai=1norteincógnitaincógnitaiy¯=1norteyi=1norteyyi{\displaystyle {\overline {\mathbf {x} }}={\frac {1}{n_{x}}}\sum _{i=1}^{n_{x}}\mathbf {x} _{i}\qquad {\overline {\mathbf {y} }}={\frac {1}{n_{y}}}\sum _{i=1}^{n_{y}}\mathbf {y} _{i}}

como medias de muestra, y

Σ^incógnita=1norteincógnita1i=1norteincógnita(incógnitaiincógnita¯)(incógnitaiincógnita¯)Σ^y=1nortey1i=1nortey(yiy¯)(yiy¯){\displaystyle {\begin{aligned}{\hat {\mathbf {\Sigma } }}_{\mathbf {x} }&={\frac {1}{n_{x}-1}}\sum _{i=1}^{n_{x}}\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)\left(\mathbf {x} _{i}-{\overline {\mathbf {x} }}\right)'\\{\hat {\mathbf {\Sigma } }}_{\mathbf {y} }&={\frac {1}{n_{y}-1}}\sum _{i=1}^{n_{y}}\left(\mathbf {y} _{i}-{\overline {\mathbf {y} }}\right)\left(\mathbf {y} _{i}-{\overline {\mathbf {y} }}\right)'\end{aligned}}}

como las respectivas matrices de covarianza de muestra. Entonces

Σ^=(norteincógnita1)Σ^incógnita+(nortey1)Σ^ynorteincógnita+nortey2{\displaystyle {\hat {\mathbf {\Sigma } }}={\frac {(n_{x}-1){\hat {\mathbf {\Sigma } }}_{\mathbf {x} }+(n_{y}-1){\hat {\mathbf {\Sigma } }}_{\mathbf {y} }}{n_{x}+n_{y}-2}}}

es la estimación insesgada de la matriz de covarianza combinada (una extensión de la varianza combinada ).

Finalmente, el estadístico t- cuadrado de dos muestras de Hotelling es

t2=norteincógnitanorteynorteincógnita+nortey(incógnita¯y¯)Σ^1(incógnita¯y¯)T2(pag,norteincógnita+nortey2){\displaystyle t^{2}={\frac {n_{x}n_{y}}{n_{x}+n_{y}}}({\overline {\mathbf {x} }}-{\overline {\mathbf {y} }})'{\hat {\mathbf {\Sigma } }}^{-1}({\overline {\mathbf {x} }}-{\overline {\mathbf {y} }})\sim T^{2}(p,n_{x}+n_{y}-2)}

Se puede relacionar con la distribución F mediante [ 4 ].

norteincógnita+norteypag1(norteincógnita+nortey2)pagt2F(pag,norteincógnita+nortey1pag).{\displaystyle {\frac {n_{x}+n_{y}-p-1}{(n_{x}+n_{y}-2)p}}t^{2}\sim F(p,n_{x}+n_{y}-1-p).}

La distribución no nula de este estadístico es la distribución F no central (la razón entre una variable aleatoria chi-cuadrado no central y una variable aleatoria chi-cuadrado central independiente).norteincógnita+norteypag1(norteincógnita+nortey2)pagt2F(pag,norteincógnita+nortey1pag;δ),{\displaystyle {\frac {n_{x}+n_{y}-p-1}{(n_{x}+n_{y}-2)p}}t^{2}\sim F(p,n_{x}+n_{y}-1-p;\delta ),} con δ=norteincógnitanorteynorteincógnita+norteydΣ1d,{\displaystyle \delta ={\frac {n_{x}n_{y}}{n_{x}+n_{y}}}{\boldsymbol {d}}'\mathbf {\Sigma } ^{-1}{\boldsymbol {d}},} dónded=incógnita¯y¯{\displaystyle {\boldsymbol {d}}=\mathbf {{\overline {x}}-{\overline {y}}} }es el vector de diferencias entre las medias poblacionales.

En el caso de dos variables, la fórmula se simplifica muy bien, lo que permite apreciar cómo la correlación,ρ{\displaystyle \rho }, entre las variables afectat2{\displaystyle t^{2}}. Si definimos d1=incógnita¯1y¯1,d2=incógnita¯2y¯2{\displaystyle d_{1}={\overline {x}}_{1}-{\overline {y}}_{1},\qquad d_{2}={\overline {x}}_{2}-{\overline {y}}_{2}} y s1=Σ11s2=Σ22ρ=Σ12/(s1s2)=Σ21/(s1s2){\displaystyle s_{1}={\sqrt {\Sigma _{11}}}\qquad s_{2}={\sqrt {\Sigma _{22}}}\qquad \rho =\Sigma _{12}/(s_{1}s_{2})=\Sigma _{21}/(s_{1}s_{2})} entonces t2=norteincógnitanortey(norteincógnita+nortey)(1ρ2)[(d1s1)2+(d2s2)22ρ(d1s1)(d2s2)]{\displaystyle t^{2}={\frac {n_{x}n_{y}}{(n_{x}+n_{y})(1-\rho ^{2})}}\left[\left({\frac {d_{1}}{s_{1}}}\right)^{2}+\left({\frac {d_{2}}{s_{2}}}\right)^{2}-2\rho \left({\frac {d_{1}}{s_{1}}}\right)\left({\frac {d_{2}}{s_{2}}}\right)\right]} Por lo tanto, si las diferencias en las dos filas del vectord=incógnita¯y¯{\displaystyle \mathbf {d} ={\overline {\mathbf {x} }}-{\overline {\mathbf {y} }}}son del mismo signo, en general,t2{\displaystyle t^{2}}se vuelve más pequeño a medida queρ{\displaystyle \rho }se vuelve más positivo. Si las diferencias son de signo opuestot2{\displaystyle t^{2}}se hace más grande a medida queρ{\displaystyle \rho }se vuelve más positivo.

Un caso especial univariado se puede encontrar en la prueba t de Welch .

En la literatura se han propuesto pruebas más robustas y potentes que la prueba de dos muestras de Hotelling; véanse, por ejemplo, las pruebas basadas en la distancia entre puntos, que pueden aplicarse incluso cuando el número de variables es comparable o incluso mayor que el número de sujetos. [ 9 ] [ 10 ]

Véase también

Referencias

  1. 1 2 3 Hotelling, H. (1931). "La generalización del coeficiente t de Student" . Anales de Estadística Matemática . 2 (3): 360– 378. doi : 10.1214/aoms/1177732979 .
  2. Johnson, RA; Wichern, DW (2002). Análisis estadístico multivariante aplicado . Vol. 5. Prentice Hall. 
  3. Eric W. Weisstein, MathWorld
  4. 1 2 Mardia, KV; Kent, JT; Bibby, JM (1979). Análisis multivariante . Academic Press. ISBN 978-0-12-471250-8.
  5. Fogelmark, Karl; Lomholt, Michael; Irbäck, Anders; Ambjörnsson, Tobias (3 de mayo de 2018). "Ajustar una función a datos promediados de conjuntos dependientes del tiempo" . Informes científicos . 8 (1): 6984. arXiv : 1805.03057 . Código Bib : 2018NatSR...8.6984F . doi : 10.1038/s41598-018-24983-y . PMC 5934400 . PMID 29725108 .  
  6. ↑ "6.5.4.3. T al cuadrado de Hotelling " .
  7. Fin del capítulo 4.2 de Johnson, RA y Wichern, DW (2002)
  8. Billingsley, P. (1995). "26. Funciones características". Probabilidad y medida (3.ª ed.). Wiley. ISBN  978-0-471-00710-4.
  9. Marozzi, M. (2016). "Pruebas multivariadas basadas en distancias entre puntos con aplicación a imágenes por resonancia magnética". Métodos estadísticos en investigación médica . 25 (6): 2593– 2610. doi : 10.1177/0962280214529104 . PMID 24740998 . 
  10. Marozzi, M. (2015). "Pruebas de multidistancia multivariadas para estudios de casos y controles de alta dimensión y tamaño de muestra reducido". Statistics in Medicine . 34 (9): 1511– 1526. doi : 10.1002/sim.6418 . PMID 25630579 .