Articulo de referencia

Modos de variación

En estadística, los modos de variación [ 1 ] son ​​un conjunto de vectores o funciones indexados continuamente que están centrados en una media y se utilizan para representar la...

En estadística, los modos de variación [ 1 ] son ​​un conjunto de vectores o funciones indexados continuamente que están centrados en una media y se utilizan para representar la variación en una población o muestra. Típicamente, los patrones de variación en los datos se pueden descomponer en orden descendente de valores propios con las direcciones representadas por los vectores propios o funciones propias correspondientes . Los modos de variación proporcionan una visualización de esta descomposición y una descripción eficiente de la variación alrededor de la media. Tanto en el análisis de componentes principales (PCA) como en el análisis de componentes principales funcionales (FPCA), los modos de variación juegan un papel importante en la visualización y descripción de la variación en los datos aportada por cada componente propio. [ 2 ] En aplicaciones del mundo real, los componentes propios y los modos de variación asociados ayudan a interpretar datos complejos, especialmente en el análisis exploratorio de datos (EDA).

Formulación

Los modos de variación son una extensión natural del PCA y del FPCA .

Si un vector aleatorioincógnita=(incógnita1,incógnita2,,incógnitapag)T{\displaystyle \mathbf {X} =(X_{1},X_{2},\cdots ,X_{p})^{T}}tiene el vector medioμpag{\displaystyle {\boldsymbol {\mu }}_{p}}y la matriz de covarianzaΣpag×pag{\displaystyle \mathbf {\Sigma } _{p\times p}}con valores propiosλ1λ2λpag0{\displaystyle \lambda _{1}\geq \lambda _{2}\geq \cdots \geq \lambda _{p}\geq 0}y los correspondientes autovectores ortonormalesmi1,mi2,,mipag{\displaystyle \mathbf {e} _{1},\mathbf {e} _{2},\cdots,\mathbf {e} _{p}}, mediante la descomposición en valores propios de una matriz simétrica real , la matriz de covarianzaΣ{\displaystyle \mathbf {\Sigma } }puede descomponerse como

Σ=QΛQT,{\displaystyle \mathbf {\Sigma } =\mathbf {Q} \mathbf {\Lambda } \mathbf {Q} ^{T},}

dóndeQ{\displaystyle \mathbf {Q} }es una matriz ortogonal cuyas columnas son los vectores propios deΣ{\displaystyle \mathbf {\Sigma } }, yΛ{\displaystyle \mathbf {\Lambda } }es una matriz diagonal cuyas entradas son los valores propios deΣ{\displaystyle \mathbf {\Sigma } }. Mediante la expansión de Karhunen-Loève para vectores aleatorios, se puede expresar el vector aleatorio centrado en la base propia.

incógnitaμ=k=1pagξkmik,{\displaystyle \mathbf {X} -{\boldsymbol {\mu }}=\sum _{k=1}^{p}\xi _{k}\mathbf {e} _{k},}

dóndeξk=mikT(incógnitaμ){\displaystyle \xi _{k}=\mathbf {e} _{k}^{T}(\mathbf {X} -{\boldsymbol {\mu }})}es el componente principal [ 3 ] asociado con elk{\displaystyle k}-ésimo vector propiomik{\displaystyle \mathbf {e} _ {k}}, con las propiedades

mi(ξk)=0,Var(ξk)=λk,{\displaystyle \operatorname {E} (\xi _{k})=0,\operatorname {Var} (\xi _{k})=\lambda _{k},}ymi(ξkξl)=0 para lk.{\displaystyle \operatorname {E} (\xi _{k}\xi _{l})=0\ {\text{para}}\ l\neq k.}

Entonces elk{\displaystyle k}-ésimo modo de variación deincógnita{\displaystyle \mathbf {X} }es el conjunto de vectores, indexados porα{\displaystyle \alpha },

metrok,α=μ±αλkmik,α[A,A],{\displaystyle \mathbf {m} _{k,\alpha }={\boldsymbol {\mu }}\pm \alpha {\sqrt {\lambda _{k}}}\mathbf {e} _{k},\alpha \in [-A,A],}

dóndeA{\displaystyle A}se selecciona típicamente como2 o 3{\displaystyle 2\ {\text{o}}\ 3}.

Modos de variación en FPCA

Para una función aleatoria de cuadrado integrableincógnita(t),tTRpag{\displaystyle X(t),t\in {\mathcal {T}}\subset R^{p}}donde normalmentepag=1{\displaystyle p=1}yT{\displaystyle {\mathcal {T}}}es un intervalo, denotemos la función media porμ(t)=mi(incógnita(t)){\displaystyle \mu (t)=\operatorname {E} (X(t))}y la función de covarianza por

GRAMO(s,t)=Cov(incógnita(s),incógnita(t))=k=1λkφk(s)φk(t),{\displaystyle G(s,t)=\operatorname {Cov} (X(s),X(t))=\sum _{k=1}^{\infty }\lambda _{k}\varphi _{k}(s)\varphi _{k}(t),}

dóndeλ1λ20{\displaystyle \lambda _{1}\geq \lambda _{2}\geq \cdots \geq 0}son los valores propios y{φ1,φ2,}{\displaystyle \{\varphi _{1},\varphi _{2},\cdots \}}son las autofunciones ortonormales del operador lineal de Hilbert-Schmidt

GRAMO:L2(T)L2(T),GRAMO(F)=TGRAMO(s,t)F(s)ds.{\displaystyle G:L^{2}({\mathcal {T}})\rightarrow L^{2}({\mathcal {T}}),\,G(f)=\int _{\mathcal {T}}G(s,t)f(s)ds.}

Según el teorema de Karhunen-Loève , se puede expresar la función centrada en la base propia,

incógnita(t)μ(t)=k=1ξkφk(t),{\displaystyle X(t)-\mu (t)=\sum _{k=1}^{\infty }\xi _{k}\varphi _{k}(t),}

dónde

ξk=T(incógnita(t)μ(t))φk(t)dt{\displaystyle \xi _{k}=\int _{\mathcal {T}}(X(t)-\mu (t))\varphi _{k}(t)dt}

es elk{\displaystyle k}-ésimo componente principal con las propiedades

mi(ξk)=0,Var(ξk)=λk,{\displaystyle \operatorname {E} (\xi _{k})=0,\operatorname {Var} (\xi _{k})=\lambda _{k},}ymi(ξkξl)=0 para lk.{\displaystyle \operatorname {E} (\xi _{k}\xi _{l})=0{\text{ para }}l\neq k.}

Entonces elk{\displaystyle k}-ésimo modo de variación deincógnita(t){\displaystyle X(t)}es el conjunto de funciones, indexadas porα{\displaystyle \alpha },

metrok,α(t)=μ(t)±αλkφk(t), tT, α[A,A]{\displaystyle m_{k,\alpha }(t)=\mu (t)\pm \alpha {\sqrt {\lambda _{k}}}\varphi _{k}(t),\ t\in {\mathcal {T}},\ \alpha \in [-A,A]}

que se visualizan simultáneamente en el rango deα{\displaystyle \alpha }, generalmente paraA=2 o 3{\displaystyle A=2\ {\text{o}}\ 3}. [ 2 ]

Estimación

La formulación anterior se deriva de las propiedades de la población. La estimación es necesaria en aplicaciones prácticas. La idea clave es estimar la media y la covarianza.

Supongamos que los datosincógnita1,incógnita2,,incógnitanorte{\displaystyle \mathbf {x} _{1},\mathbf {x} _{2},\cdots ,\mathbf {x} _{n}}representarnorte{\displaystyle n}dibujos independientes de algunospag{\displaystyle p}población dimensionalincógnita{\displaystyle \mathbf {X} }con vector medioμ{\displaystyle {\boldsymbol {\mu }}}y matriz de covarianzaΣ{\displaystyle \mathbf {\Sigma } }Estos datos producen el vector de medias de la muestra.incógnita¯{\displaystyle {\overline {\mathbf {x} }}}y la matriz de covarianza de la muestraS{\displaystyle \mathbf {S} }con pares de autovalores y autovectores(λ^1,mi^1),(λ^2,mi^2),,(λ^pag,mi^pag){\displaystyle ({\hat {\lambda }}_{1},{\hat {\mathbf {e} }}_{1}),({\hat {\lambda }}_{2},{\hat {\mathbf {e} }}_{2}),\cdots ,({\hat {\lambda }}_{p},{\hat {\mathbf {e} }}_{p})}. Entonces elk{\displaystyle k}-ésimo modo de variación deincógnita{\displaystyle \mathbf {X} }puede ser estimado por

metro^k,α=incógnita¯±αλ^kmi^k,α[A,A].{\displaystyle {\hat {\mathbf {m} }}_{k,\alpha }={\overline {\mathbf {x} }}\pm \alpha {\sqrt {{\hat {\lambda }}_{k}}}{\hat {\mathbf {e} }}_{k},\alpha \in [-A,A].}

Modos de variación en FPCA

Considerarnorte{\displaystyle n}realizacionesincógnita1(t),incógnita2(t),,incógnitanorte(t){\displaystyle X_{1}(t),X_{2}(t),\cdots ,X_{n}(t)}de una función aleatoria de cuadrado integrableincógnita(t),tT{\displaystyle X(t),t\in {\mathcal {T}}}con la función mediaμ(t)=mi(incógnita(t)){\displaystyle \mu (t)=\operatorname {E} (X(t))}y la función de covarianzaGRAMO(s,t)=Cov(incógnita(s),incógnita(t)){\displaystyle G(s,t)=\operatorname {Cov} (X(s),X(t))}El análisis de componentes principales funcionales proporciona métodos para la estimación deμ(t){\displaystyle \mu (t)}yGRAMO(s,t){\displaystyle G(s,t)}en detalle, a menudo implicando estimación e interpolación punto por punto . Sustituyendo estimaciones por las cantidades desconocidas,k{\displaystyle k}-ésimo modo de variación deincógnita(t){\displaystyle X(t)}puede ser estimado por

metro^k,α(t)=μ^(t)±αλ^kφ^k(t),tT,α[A,A].{\displaystyle {\hat {m}}_{k,\alpha }(t)={\hat {\mu }}(t)\pm \alpha {\sqrt {{\hat {\lambda }}_{k}}}{\hat {\varphi }}_{k}(t),t\in {\mathcal {T}},\alpha \in [-A,A].}

Aplicaciones

Los dos primeros modos de variación de los datos de mortalidad femenina de 41 países en 2003 [ 4 ]
Los dos primeros modos de variación de los datos de mortalidad masculina de 41 países en 2003 [ 4 ]

Los modos de variación son útiles para visualizar y describir los patrones de variación en los datos ordenados por los autovalores. En aplicaciones del mundo real, los modos de variación asociados con los autocomponentes permiten interpretar datos complejos, como la evolución de rasgos funcionales [ 5 ] y otros datos de dimensión infinita. [ 6 ] Para ilustrar cómo funcionan los modos de variación en la práctica, se muestran dos ejemplos en los gráficos de la derecha, que muestran los dos primeros modos de variación. La curva continua representa la función de la media de la muestra. Las curvas discontinua, de puntos y rayas, y de puntos corresponden a modos de variación conα=±1,±2,{\displaystyle \alpha =\pm 1,\pm 2,}y±3{\displaystyle \pm 3}, respectivamente.

El primer gráfico muestra los dos primeros modos de variación de los datos de mortalidad femenina de 41 países en 2003. [ 4 ] El objeto de interés es la función de riesgo logarítmico entre las edades de 0 y 100 años. El primer modo de variación sugiere que la variación de la mortalidad femenina es menor para edades cercanas a 0 o 100 años, y mayor para edades cercanas a 25 años. Una interpretación apropiada e intuitiva es que la mortalidad alrededor de los 25 años se debe a muertes accidentales, mientras que alrededor de los 0 o 100 años, la mortalidad está relacionada con enfermedades congénitas o muerte natural.

En comparación con los datos de mortalidad femenina, las variaciones en los datos de mortalidad masculina muestran una mayor mortalidad a partir de los 20 años, posiblemente debido a que la esperanza de vida de las mujeres es mayor que la de los hombres.

Referencias

  1. Castro, PE; Lawton, WH; Sylvestre, EA (noviembre de 1986). "Modos principales de variación para procesos con curvas de muestra continuas". Technometrics . 28 (4): 329. doi : 10.2307/1268982 . ISSN 0040-1706 . JSTOR 1268982 .  
  2. 1 2 Wang, Jane-Ling; Chiou, Jeng-Min; Müller, Hans-Georg (junio de 2016). "Análisis de datos funcionales" . Annual Review of Statistics and Its Application . 3 (1): 257– 295. doi : 10.1146/annurev-statistics-041715-033624 . ISSN 2326-8298 . 
  3. Kleffe, Jürgen (enero de 1973). "Componentes principales de variables aleatorias con valores en un espacio HILBERT separable". Mathematische Operationsforschung und Statistik . 4 (5): 391– 406. doi : 10.1080/02331887308801137 . ISSN 0047-6277 . 
  4. 1 2 3 "Base de datos de mortalidad humana" . www.mortality.org . Consultado el 12 de marzo de 2020 .
  5. Kirkpatrick, Mark; Heckman, Nancy (agosto de 1989). "Un modelo genético cuantitativo para el crecimiento, la forma, las normas de reacción y otros caracteres de dimensión infinita". Journal of Mathematical Biology . 27 (4): 429– 450. doi : 10.1007/bf00290638 . ISSN 0303-6812 . PMID 2769086. S2CID 46336613 .   
  6. Jones, MC; Rice, John A. (mayo de 1992). "Mostrando las características importantes de grandes colecciones de curvas similares". The American Statistician . 46 (2): 140– 145. doi : 10.1080/00031305.1992.10475870 . ISSN 0003-1305 .