Articulo de referencia

Distribución normal multivariada

Many sample points from a multivariate normal distribution with \\boldsymbol\\mu = \\left[\\begin{smallmatrix}0 \\\\ 0\\end{smallmatrix}\\right] and \\boldsymbol\\Sigma = \\left...

En teoría de la probabilidad y estadística , la distribución normal multivariada , la distribución gaussiana multivariada o la distribución normal conjunta son generalizaciones de la distribución normal unidimensional ( univariada ) a dimensiones superiores . Una definición establece que un vector aleatorio se distribuye normalmente de k variables si toda combinación lineal de sus k componentes tiene una distribución normal univariada. Su importancia se deriva principalmente del teorema del límite central multivariado . La distribución normal multivariada se utiliza a menudo para describir, al menos de forma aproximada, cualquier conjunto de variables aleatorias de valor real (posiblemente) correlacionadas , cada una de las cuales se agrupa alrededor de un valor medio.

Definiciones

Notación y parametrización

La distribución normal multivariada de un vector aleatorio k -dimensionalincógnita=(incógnita1,,incógnitak)T{\displaystyle \mathbf {X} =(X_{1},\ldots ,X_{k})^{\mathrm {T} }}se puede escribir con la siguiente notación:

incógnita  norte(μ,Σ),{\displaystyle \mathbf {X} \ \sim \ {\mathcal {N}}({\boldsymbol {\mu }},\,{\boldsymbol {\Sigma }}),}

o para dar a conocer explícitamente queincógnita{\displaystyle \mathbf {X} }es k -dimensional,

incógnita  nortek(μ,Σ),{\displaystyle \mathbf {X} \ \sim \ {\mathcal {N}}_{k}({\boldsymbol {\mu }},\,{\boldsymbol {\Sigma }}),}

con vector medio k -dimensional

μ=mi[incógnita]=(mi[incógnita1],mi[incógnita2],,mi[incógnitak])T,{\displaystyle {\boldsymbol {\mu }}=\operatorname {E} [\mathbf {X} ]=(\operatorname {E} [X_{1}],\operatorname {E} [X_{2}],\ldots ,\operatorname {E} [X_{k}])^{\mathrm {T} },}

yk×k{\displaystyle k\times k}matriz de covarianza

Σi,j=mi[(incógnitaiμi)(incógnitajμj)]=Cov[incógnitai,incógnitaj]{\displaystyle \Sigma _{i,j}=\operatorname {E} [(X_{i}-\mu _{i})(X_{j}-\mu _{j})]=\operatorname {Cov} [X_{i},X_{j}]}

de tal manera que1ik{\displaystyle 1\leq i\leq k}y1jk{\displaystyle 1\leq j\leq k}. La inversa de la matriz de covarianza se llama matriz de precisión , denotada porQ=Σ1{\displaystyle {\boldsymbol {Q}}={\boldsymbol {\Sigma }}^{-1}}.

vector aleatorio normal estándar

Un vector aleatorio realincógnita=(incógnita1,,incógnitak)T{\displaystyle \mathbf {X} =(X_{1},\ldots ,X_{k})^{\mathrm {T} }}Se denomina vector aleatorio normal estándar si todos sus componentesincógnitai{\displaystyle X_{i}}son independientes y cada una es una variable aleatoria con distribución normal de media cero y varianza unitaria, es decir, siincógnitai norte(0,1){\displaystyle X_{i}\sim \ {\mathcal {N}}(0,1)}a pesar dei=1k{\displaystyle i=1\ldots k}. [ 1 ] : pág. 454

Vector aleatorio normal centrado

Un vector aleatorio realincógnita=(incógnita1,,incógnitak)T{\displaystyle \mathbf {X} =(X_{1},\ldots ,X_{k})^{\mathrm {T} }}Se denomina vector aleatorio normal centrado si existe unk×{\displaystyle k\times \ell }matrizA{\displaystyle {\boldsymbol {A}}}de tal manera queAZ{\displaystyle {\boldsymbol {A}}\mathbf {Z} }tiene la misma distribución queincógnita{\displaystyle \mathbf {X} }dóndeZ{\displaystyle \mathbf {Z} }es un vector aleatorio normal estándar con{\displaystyle \ell }componentes. [ 1 ] : pág. 454

vector aleatorio normal

Un vector aleatorio realincógnita=(incógnita1,,incógnitak)T{\displaystyle \mathbf {X} =(X_{1},\ldots ,X_{k})^{\mathrm {T} }}Se denomina vector aleatorio normal si existe un vector aleatorio{\displaystyle \ell }-vectorZ{\displaystyle \mathbf {Z} }, que es un vector aleatorio normal estándar, unk{\displaystyle k}-vectorμ{\displaystyle {\boldsymbol {\mu }}}y unk×{\displaystyle k\times \ell }matrizA{\displaystyle {\boldsymbol {A}}}, de tal manera queincógnita=AZ+μ{\displaystyle \mathbf {X} ={\boldsymbol {A}}\mathbf {Z} +{\boldsymbol {\mu }}}. [ 2 ] : pág. 454 [ 1 ] : pág. 455

Formalmente:

incógnita  nortek(μ,Σ)existen μRk,ARk× de tal manera que incógnita=AZ+μ y norte=1,,:Znorte norte(0,1),iid{\displaystyle \mathbf {X} \ \sim \ {\mathcal {N}}_{k}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})\iff {\text{there exist }}{\boldsymbol {\mu }}\in \mathbb {R} ^{k},{\boldsymbol {A}}\in \mathbb {R} ^{k\times \ell }{\text{ such that }}\mathbf {X} ={\boldsymbol {A}}\mathbf {Z} +{\boldsymbol {\mu }}{\text{ and }}\forall n=1,\ldots ,\ell :Z_{n}\sim \ {\mathcal {N}}(0,1),{\text{i.i.d.}}}

Aquí la matriz de covarianza esΣ=AAT{\displaystyle {\boldsymbol {\Sigma }}={\boldsymbol {A}}{\boldsymbol {A}}^{\mathrm {T} }}.

En el caso degenerado donde la matriz de covarianza es singular , la distribución correspondiente no tiene densidad; consulte la sección siguiente para obtener más detalles. Este caso surge con frecuencia en estadística ; por ejemplo, en la distribución del vector de residuos en la regresión de mínimos cuadrados ordinarios .incógnitai{\displaystyle X_{i}}En general no son independientes; pueden verse como el resultado de aplicar la matrizA{\displaystyle {\boldsymbol {A}}}a una colección de variables gaussianas independientesZ{\displaystyle \mathbf {Z} }.

Definiciones equivalentes

Las siguientes definiciones son equivalentes a la definición dada anteriormente. Un vector aleatorioincógnita=(incógnita1,,incógnitak)T{\displaystyle \mathbf {X} =(X_{1},\ldots ,X_{k})^{\mathrm {T} }}Tiene una distribución normal multivariada si satisface una de las siguientes condiciones equivalentes.

  • Cada combinación linealY=a1incógnita1++akincógnitak{\displaystyle Y=a_{1}X_{1}+\cdots +a_{k}X_{k}}de sus componentes se distribuye normalmente . Es decir, para cualquier vector constanteaRk{\displaystyle \mathbf {a} \in \mathbb {R} ^{k}}, la variable aleatoriaY=aTincógnita{\displaystyle Y=\mathbf {a} ^{\mathrm {T} }\mathbf {X} }tiene una distribución normal univariada, donde una distribución normal univariada con varianza cero es una masa puntual en su media.
  • Hay un vector kμ{\displaystyle \mathbf {\mu } }y una semidefinida positiva simétricak×k{\displaystyle k\times k}matrizΣ{\displaystyle {\boldsymbol {\Sigma }}}, de tal manera que la función característica deincógnita{\displaystyle \mathbf {X} }esφincógnita()=exp(iTμ12TΣ).{\displaystyle \varphi _{\mathbf {X} }(\mathbf {u} )=\exp {\Big (}i\mathbf {u} ^{\mathrm {T} }{\boldsymbol {\mu }}-{\tfrac {1}{2}}\mathbf {u} ^{\mathrm {T} }{\boldsymbol {\Sigma }}\mathbf {u} {\Big )}.}

La distribución normal esférica puede caracterizarse como la única distribución cuyos componentes son independientes en cualquier sistema de coordenadas ortogonales. [ 3 ] [ 4 ]

Función de densidad

Densidad articular normal bivariada

Caso no degenerado

Se dice que la distribución normal multivariada es "no degenerada" cuando la matriz de covarianza simétricaΣ{\displaystyle {\boldsymbol {\Sigma }}}es definida positiva . En este caso, la distribución tiene densidad [ 5 ].

Fincógnita(incógnita1,,incógnitak)=exp(12(incógnitaμ)TΣ1(incógnitaμ))(2π)k|Σ|{\displaystyle f_{\mathbf {X} }(x_{1},\ldots ,x_{k})={\frac {\exp \left(-{\frac {1}{2}}\left({\mathbf {x} }-{\boldsymbol {\mu }}\right)^{\mathrm {T} }{\boldsymbol {\Sigma }}^{-1}\left({\mathbf {x} }-{\boldsymbol {\mu }}\right)\right)}{\sqrt {(2\pi )^{k}|{\boldsymbol {\Sigma }}|}}}}

dóndeincógnita{\displaystyle {\mathbf {x} }}es un vector columna real de k dimensiones y|Σ|detΣ{\displaystyle |{\boldsymbol {\Sigma }}|\equiv \det {\boldsymbol {\Sigma }}}es el determinante deΣ{\displaystyle {\boldsymbol {\Sigma }}}, también conocida como varianza generalizada . La subexpresión(2π)k|Σ|{\displaystyle (2\pi )^{k}|{\boldsymbol {\Sigma }}|}puede reescribirse como|2πΣ|{\displaystyle |2\pi {\boldsymbol {\Sigma }}|}, lo cual es especialmente útil en el caso degenerado; véase más abajo. La ecuación anterior se reduce a la de la distribución normal univariada siΣ{\displaystyle {\boldsymbol {\Sigma }}}es un1×1{\displaystyle 1\times 1}matriz (es decir, un solo número real).

La versión circularmente simétrica de la distribución normal compleja tiene una forma ligeramente diferente.

Cada lugar geométrico de isodensidad —el lugar geométrico de puntos en un espacio k- dimensional, cada uno de los cuales da el mismo valor particular de la densidad— es una elipse o su generalización de dimensiones superiores; por lo tanto, la distribución normal multivariada es un caso especial de las distribuciones elípticas .

La cantidad(incógnitaμ)TΣ1(incógnitaμ){\displaystyle {\sqrt {({\mathbf {x} }-{\boldsymbol {\mu }})^{\mathrm {T} }{\boldsymbol {\Sigma }}^{-1}({\mathbf {x} }-{\boldsymbol {\mu }})}}}se conoce como la distancia de Mahalanobis , que representa la distancia del punto de pruebaincógnita{\displaystyle {\mathbf {x} }}de la mediaμ{\displaystyle {\boldsymbol {\mu }}}La distancia de Mahalanobis al cuadrado (incógnitaμ)TΣ1(incógnitaμ){\displaystyle ({\mathbf {x} }-{\boldsymbol {\mu }})^{\mathrm {T} }{\boldsymbol {\Sigma }}^{-1}({\mathbf {x} }-{\boldsymbol {\mu }})}se descompone en una suma de k términos, siendo cada término un producto de tres componentes significativos. [ 6 ] Nótese que en el caso en quek=1{\displaystyle k=1}La distribución se reduce a una distribución normal univariada y la distancia de Mahalanobis se reduce al valor absoluto de la puntuación estándar . Véase también Intervalo más abajo.

Caso bivariado

En el caso bidimensional no singular (k=rango(Σ)=2{\displaystyle k=\operatorname {rank} \left(\Sigma \right)=2}), la función de densidad de probabilidad de un vector[XY]{\displaystyle {\text{[XY]}}\prime }es: F(incógnita,y)=12πσincógnitaσY1ρ2exp(12[1ρ2][(incógnitaμincógnitaσincógnita)22ρ(incógnitaμincógnitaσincógnita)(yμYσY)+(yμYσY)2]){\displaystyle f(x,y)={\frac {1}{2\pi \sigma _{X}\sigma _{Y}{\sqrt {1-\rho ^{2}}}}}\exp \left(-{\frac {1}{2\left[1-\rho ^{2}\right]}}\left[\left({\frac {x-\mu _{X}}{\sigma _{X}}}\right)^{2}-2\rho \left({\frac {x-\mu _{X}}{\sigma _{X}}}\right)\left({\frac {y-\mu _{Y}}{\sigma _{Y}}}\right)+\left({\frac {y-\mu _{Y}}{\sigma _{Y}}}\right)^{2}\right]\right)} dóndeρ{\displaystyle \rho }es la correlación entreincógnita{\displaystyle X}yY{\displaystyle Y}y dóndeσincógnita>0{\displaystyle \sigma _{X}>0}yσY>0{\displaystyle \sigma _{Y}>0}. En este caso,

μ=(μincógnitaμY),Σ=(σincógnita2ρσincógnitaσYρσincógnitaσYσY2).{\displaystyle {\boldsymbol {\mu }}={\begin{pmatrix}\mu _{X}\\\mu _{Y}\end{pmatrix}},\quad {\boldsymbol {\Sigma }}={\begin{pmatrix}\sigma _{X}^{2}&\rho \sigma _{X}\sigma _{Y}\\\rho \sigma _{X}\sigma _{Y}&\sigma _{Y}^{2}\end{pmatrix}}.}

En el caso bivariado, la primera condición equivalente para la reconstrucción multivariada de la normalidad puede hacerse menos restrictiva, ya que basta con verificar que existe un conjunto infinito numerable de combinaciones lineales distintas deincógnita{\displaystyle X}yY{\displaystyle Y}son normales para concluir que el vector de [XY]{\displaystyle {\text{[XY]}}\prime }es normal bivariada. [ 7 ]

Los loci de isodensidad bivariada representados en el incógnita,y{\displaystyle x,y}Los planos son elipses , cuyos ejes principales están definidos por los vectores propios de la matriz de covarianza.Σ{\displaystyle {\boldsymbol {\Sigma }}}(los semidiámetros mayor y menor de la elipse son iguales a la raíz cuadrada de los autovalores ordenados).

Distribución normal bivariada centrada en(1,3){\displaystyle (1,3)}con una desviación estándar de 3 en aproximadamente el(0,878,0,478){\displaystyle (0.878,0.478)}dirección y de  1 en la dirección ortogonal.

Como el valor absoluto del parámetro de correlación ρ{\displaystyle \rho }A medida que aumentan, estos loci se comprimen hacia la siguiente línea  :

y(incógnita)=sgn(ρ)σYσincógnita(incógnitaμincógnita)+μY.{\displaystyle y(x)=\operatorname {sgn}(\rho ){\frac {\sigma _{Y}}{\sigma _{X}}}(x-\mu _{X})+\mu _{Y}.}

Esto se debe a que esta expresión, consgn(ρ){\displaystyle \operatorname {sgn}(\rho )}(donde sgn es la función signo ) reemplazado porρ{\displaystyle \rho }, es la mejor predicción lineal insesgada deY{\displaystyle Y}dado un valor deincógnita{\displaystyle X}. [ 8 ]

Caso degenerado

Si la matriz de covarianzaΣ{\displaystyle {\boldsymbol {\Sigma }}}Si no tiene rango completo, entonces la distribución normal multivariada es degenerada y no tiene densidad. Más precisamente, no tiene densidad con respecto a la medida de Lebesgue k -dimensional (que es la medida habitual asumida en los cursos de probabilidad de nivel de cálculo). Solo se dice que los vectores aleatorios cuyas distribuciones son absolutamente continuas con respecto a una medida tienen densidades (con respecto a esa medida). Para hablar de densidades pero evitar lidiar con complicaciones de la teoría de la medida, puede ser más simple restringir la atención a un subconjunto derango(Σ){\displaystyle \operatorname {rank} ({\boldsymbol {\Sigma }})}de las coordenadas deincógnita{\displaystyle \mathbf {x} }De tal manera que la matriz de covarianza para este subconjunto sea definida positiva, entonces las demás coordenadas pueden considerarse como una función afín de estas coordenadas seleccionadas. [ 9 ]

Para hablar de densidades de manera significativa en casos singulares, entonces debemos seleccionar una medida base diferente. Usando el teorema de desintegración podemos definir una restricción de la medida de Lebesgue a larango(Σ){\displaystyle \operatorname {rank} ({\boldsymbol {\Sigma }})}subespacio afín de dimensión -Rk{\displaystyle \mathbb {R} ^{k}}donde se admite la distribución gaussiana, es decir{μ+Σ1/2v:vRk}{\displaystyle \left\{{\boldsymbol {\mu }}+{\boldsymbol {\Sigma ^{1/2}}}\mathbf {v} :\mathbf {v} \in \mathbb {R} ^{k}\right\}} . Con respecto a esta medida, la distribución tiene la densidad del siguiente motivo:

F(incógnita)=exp(12(incógnitaμ)TΣ+(incógnitaμ))det(2πΣ){\displaystyle f(\mathbf {x} )={\frac {\exp \left(-{\frac {1}{2}}\left(\mathbf {x} -{\boldsymbol {\mu }}\right)^{\mathrm {T} }{\boldsymbol {\Sigma }}^{+}\left(\mathbf {x} -{\boldsymbol {\mu }}\right)\right)}{\sqrt {\det \nolimits ^{*}(2\pi {\boldsymbol {\Sigma }})}}}}

dóndeΣ+{\displaystyle {\boldsymbol {\Sigma }}^{+}}es la inversa generalizada ydet{\displaystyle \det \nolimits ^{*}}es el pseudodeterminante . [ 10 ]

Función de distribución acumulativa

La noción de función de distribución acumulativa (FDA) en dimensión 1 puede extenderse de dos maneras al caso multidimensional, basándose en regiones rectangulares y elipsoidales.

La primera forma es definir la función de distribución acumulada (cdf).F(incógnita){\displaystyle F(\mathbf {x} )}de un vector aleatorioincógnita{\displaystyle \mathbf {X} }como la probabilidad de que todos los componentes deincógnita{\displaystyle \mathbf {X} }son menores o iguales que los valores correspondientes en el vectorincógnita{\displaystyle \mathbf {x} }: [ 11 ]

F(incógnita)=PAG(incógnitaincógnita),dónde incógnitanorte(μ,Σ).{\displaystyle F(\mathbf {x} )=\mathbb {P} (\mathbf {X} \leq \mathbf {x} ),\quad {\text{where }}\mathbf {X} \sim {\mathcal {N}}({\boldsymbol {\mu }},\,{\boldsymbol {\Sigma }}).}

Aunque no existe un formulario cerrado paraF(incógnita){\displaystyle F(\mathbf {x} )}, existen varios algoritmos que lo estiman numéricamente. [ 11 ] [ 12 ]

Otra forma es definir la función de distribución acumulada (cdf).F(r){\displaystyle F(r)}como la probabilidad de que una muestra se encuentre dentro del elipsoide determinado por su distancia de Mahalanobis.r{\displaystyle r}de la gaussiana, una generalización directa de la desviación estándar. [ 13 ] Para calcular los valores de esta función, existe una fórmula analítica cerrada, [ 13 ] como sigue.

Intervalo

El intervalo para la distribución normal multivariada produce una región que consiste en aquellos vectores x que satisfacen

(incógnitaμ)TΣ1(incógnitaμ)χk2(pag).{\displaystyle ({\mathbf {x} }-{\boldsymbol {\mu }})^{\mathrm {T} }{\boldsymbol {\Sigma }}^{-1}({\mathbf {x} }-{\boldsymbol {\mu }})\leq \chi _{k}^{2}(p).}

Aquíincógnita{\displaystyle {\mathbf {x} }}es unk{\displaystyle k}vector de -dimensiones,μ{\displaystyle {\boldsymbol {\mu }}}es el conocidok{\displaystyle k}vector medio de -dimensiones,Σ{\displaystyle {\boldsymbol {\Sigma }}}es la matriz de covarianza conocida yχk2(pag){\displaystyle \chi _{k}^{2}(p)}es la función cuantil para la probabilidadpag{\displaystyle p}de la distribución chi-cuadrado conk{\displaystyle k}grados de libertad. [ 14 ] Cuandok=2,{\displaystyle k=2,}La expresión define el interior de una elipse y la distribución chi-cuadrado se simplifica a una distribución exponencial con media igual a dos (tasa igual a la mitad).

Función de distribución acumulativa complementaria (distribución de cola)

La función de distribución acumulativa complementaria (ccdf) o distribución de cola se define comoF¯(incógnita)=1PAG(incógnitaincógnita){\displaystyle {\overline {F}}(\mathbf {x} )=1-\mathbb {P} \left(\mathbf {X} \leq \mathbf {x} \right)}. Cuandoincógnitanorte(μ,Σ){\displaystyle \mathbf {X} \sim {\mathcal {N}}({\boldsymbol {\mu }},\,{\boldsymbol {\Sigma }})}, entonces la CCDF se puede escribir como una probabilidad del máximo de variables gaussianas dependientes: [ 15 ]

F¯(incógnita)=PAG(i{incógnitaiincógnitai})=PAG(máximoiYi0),dónde Ynorte(μincógnita,Σ).{\displaystyle {\overline {F}}(\mathbf {x} )=\mathbb {P} \left(\bigcup _{i}\{X_{i}\geq x_{i}\}\right)=\mathbb {P} \left(\max _{i}Y_{i}\geq 0\right),\quad {\text{where }}\mathbf {Y} \sim {\mathcal {N}}\left({\boldsymbol {\mu }}-\mathbf {x} ,\,{\boldsymbol {\Sigma }}\right).}

Aunque no existe una fórmula cerrada simple para calcular la CCDF, el máximo de variables gaussianas dependientes se puede estimar con precisión mediante el método de Monte Carlo . [ 15 ] [ 16 ]

Propiedades

Momentos

Los momentos de orden k de x están dados por

μ1,,norte(incógnita)=dmiFμr1,,rnorte(incógnita)=dmiFmi[j=1norteincógnitajrj]{\displaystyle \mu _{1,\ldots ,N}(\mathbf {x} )\mathrel {\stackrel {\mathrm {def} }{=}} \mu _{r_{1},\ldots ,r_{N}}(\mathbf {x} )\mathrel {\stackrel {\mathrm {def} }{=}} \operatorname {E} \left[\prod _{j=1}^{N}X_{j}^{r_{j}}\right]}

donde r 1 + r 2 + ⋯ + r N = k .

Los momentos centrales de orden k son los siguientes:

  1. Si k es impar, μ 1, ..., N ( xμ ) = 0 .
  2. Si k es par con k = 2 λ , entoncesμ1,,2λ(incógnitaμ)=(σijσkσincógnitaZ){\displaystyle \mu _{1,\dots ,2\lambda }(\mathbf {x} -{\boldsymbol {\mu }})=\sum \left(\sigma _{ij}\sigma _{k\ell }\cdots \sigma _{XZ}\right)}

donde la suma se toma sobre todas las asignaciones del conjunto{1,,2λ}{\displaystyle \left\{1,\ldots ,2\lambda \right\}}en λ pares (no ordenados). Es decir, para un k -ésimo (= 2 λ = 6) momento central, se suman los productos de λ = 3 covarianzas (el valor esperado μ se toma como 0 en aras de la parsimonia):

mi[incógnita1incógnita2incógnita3incógnita4incógnita5incógnita6]=mi[incógnita1incógnita2]mi[incógnita3incógnita4]mi[incógnita5incógnita6]+mi[incógnita1incógnita2]mi[incógnita3incógnita5]mi[incógnita4incógnita6]+mi[incógnita1incógnita2]mi[incógnita3incógnita6]mi[incógnita4incógnita5]+mi[incógnita1incógnita3]mi[incógnita2incógnita4]mi[incógnita5incógnita6]+mi[incógnita1incógnita3]mi[incógnita2incógnita5]mi[incógnita4incógnita6]+mi[incógnita1incógnita3]mi[incógnita2incógnita6]mi[incógnita4incógnita5]+mi[incógnita1incógnita4]mi[incógnita2incógnita3]mi[incógnita5incógnita6]+mi[incógnita1incógnita4]mi[incógnita2incógnita5]mi[incógnita3incógnita6]+mi[incógnita1incógnita4]mi[incógnita2incógnita6]mi[incógnita3incógnita5]+mi[incógnita1incógnita5]mi[incógnita2incógnita3]mi[incógnita4incógnita6]+mi[incógnita1incógnita5]mi[incógnita2incógnita4]mi[incógnita3incógnita6]+mi[incógnita1incógnita5]mi[incógnita2incógnita6]mi[incógnita3incógnita4]+mi[incógnita1incógnita6]mi[incógnita2incógnita3]mi[incógnita4incógnita5]+mi[incógnita1incógnita6]mi[incógnita2incógnita4]mi[incógnita3incógnita5]+mi[incógnita1incógnita6]mi[incógnita2incógnita5]mi[incógnita3incógnita4].{\displaystyle {\begin{aligned}&\operatorname {E} [X_{1}X_{2}X_{3}X_{4}X_{5}X_{6}]\\[8pt]={}&\operatorname {E} [X_{1}X_{2}]\operatorname {E} [X_{3}X_{4}]\operatorname {E} [X_{5}X_{6}]+\operatorname {E} [X_{1}X_{2}]\operatorname {E} [X_{3}X_{5}]\operatorname {E} [X_{4}X_{6}]+\operatorname {E} [X_{1}X_{2}]\operatorname {E} [X_{3}X_{6}]\operatorname {E} [X_{4}X_{5}]\\[4pt]&{}+\operatorname {E} [X_{1}X_{3}]\operatorname {E} [X_{2}X_{4}]\operatorname {E} [X_{5}X_{6}]+\operatorname {E} [X_{1}X_{3}]\operatorname {E} [X_{2}X_{5}]\operatorname {E} [X_{4}X_{6}]+\operatorname {E} [X_{1}X_{3}]\operatorname {E} [X_{2}X_{6}]\operatorname {E} [X_{4}X_{5}]\\[4pt]&{}+\operatorname {E} [X_{1}X_{4}]\operatorname {E} [X_{2}X_{3}]\operatorname {E} [X_{5}X_{6}]+\operatorname {E} [X_{1}X_{4}]\operatorname {E} [X_{2}X_{5}]\operatorname {E} [X_{3}X_{6}]+\operatorname {E} [X_{1}X_{4}]\operatorname {E} [X_{2}X_{6}]\operatorname {E} [X_{3}X_{5}]\\[4pt]&{}+\operatorname {E} [X_{1}X_{5}]\operatorname {E} [X_{2}X_{3}]\operatorname {E} [X_{4}X_{6}]+\operatorname {E} [X_{1}X_{5}]\operatorname {E} [X_{2}X_{4}]\operatorname {E} [X_{3}X_{6}]+\operatorname {E} [X_{1}X_{5}]\operatorname {E} [X_{2}X_{6}]\operatorname {E} [X_{3}X_{4}]\\[4pt]&{}+\operatorname {E} [X_{1}X_{6}]\operatorname {E} [X_{2}X_{3}]\operatorname {E} [X_{4}X_{5}]+\operatorname {E} [X_{1}X_{6}]\operatorname {E} [X_{2}X_{4}]\operatorname {E} [X_{3}X_{5}]+\operatorname {E} [X_{1}X_{6}]\operatorname {E} [X_{2}X_{5}]\operatorname {E} [X_{3}X_{4}].\end{aligned}}}

Esto produce(2λ1)¡2λ1(λ1)¡{\displaystyle {\tfrac {(2\lambda -1)!}{2^{\lambda -1}(\lambda -1)!}}}términos en la suma (15 en el caso anterior), cada uno siendo el producto de λ (en este caso 3) covarianzas. Para momentos de cuarto orden (cuatro variables) hay tres términos. Para momentos de sexto orden hay 3 × 5 = 15 términos, y para momentos de octavo orden hay 3 × 5 × 7 = 105 términos.

Las covarianzas se determinan luego reemplazando los términos de la lista.[1,,2λ]{\displaystyle [1,\ldots ,2\lambda ]}mediante los términos correspondientes de la lista que consta de r 1 unos, luego r 2 doses, etc. Para ilustrar esto, examine el siguiente caso de momento central de cuarto orden:

mi[incógnitai4]=3σii2mi[incógnitai3incógnitaj]=3σiiσijmi[incógnitai2incógnitaj2]=σiiσjj+2σij2mi[incógnitai2incógnitajincógnitak]=σiiσjk+2σijσikmi[incógnitaiincógnitajincógnitakincógnitanorte]=σijσknorte+σikσjnorte+σinorteσjk.{\displaystyle {\begin{aligned}\operatorname {E} \left[X_{i}^{4}\right]&=3\sigma _{ii}^{2}\\[4pt]\operatorname {E} \left[X_{i}^{3}X_{j}\right]&=3\sigma _{ii}\sigma _{ij}\\[4pt]\operatorname {E} \left[X_{i}^{2}X_{j}^{2}\right]&=\sigma _{ii}\sigma _{jj}+2\sigma _{ij}^{2}\\[4pt]\operatorname {E} \left[X_{i}^{2}X_{j}X_{k}\right]&=\sigma _{ii}\sigma _{jk}+2\sigma _{ij}\sigma _{ik}\\[4pt]\operatorname {E} \left[X_{i}X_{j}X_{k}X_{n}\right]&=\sigma _{ij}\sigma _{kn}+\sigma _{ik}\sigma _{jn}+\sigma _{in}\sigma _{jk}.\end{aligned}}}

dóndeσij{\displaystyle \sigma _{ij}}es la covarianza de X i y X j . Con el método anterior, primero se encuentra el caso general para un k -ésimo momento con k variables X diferentes ,mi[incógnitaiincógnitajincógnitakincógnitanorte]{\displaystyle E\left[X_{i}X_{j}X_{k}X_{n}\right]}y luego se simplifica esto en consecuencia. Por ejemplo, parami[incógnitai2incógnitakincógnitanorte]{\displaystyle \operatorname {E} [X_{i}^{2}X_{k}X_{n}]}, se hace X i = X j y se utiliza el hecho de queσii=σi2{\displaystyle \sigma _{ii}=\sigma _{i}^{2}}.

Funciones de un vector normal

Una forma cuadrática de un vector normalincógnita{\displaystyle {\boldsymbol {x}}},q(incógnita)=incógnitaQ2incógnita+q1incógnita+q0{\displaystyle q({\boldsymbol {x}})={\boldsymbol {x}}'\mathbf {Q_{2}} {\boldsymbol {x}}+{\boldsymbol {q_{1}}}'{\boldsymbol {x}}+q_{0}}(dóndeQ2{\displaystyle \mathbf {Q_{2}} }es una matriz,q1{\displaystyle {\boldsymbol {q_{1}}}}es un vector, yq0{\displaystyle q_{0}}es un escalar), es una variable chi-cuadrado generalizada . La dirección de un vector normal sigue una distribución normal proyectada . [ 17 ]

SiF(incógnita){\displaystyle f({\boldsymbol {x}})}es una función escalar general de un vector normal, su función de densidad de probabilidad , función de distribución acumulativa y función de distribución acumulativa inversa se pueden calcular con el método numérico de trazado de rayos ( código Matlab archivado el 20 de febrero de 2025 en Wayback Machine ).

Función de verosimilitud

Si se conocen la media y la matriz de covarianza, la verosimilitud logarítmica de un vector observadoincógnita{\displaystyle {\boldsymbol {x}}}es simplemente el logaritmo de la función de densidad de probabilidad :

lnL(incógnita)=12[ln(|Σ|)+(incógnitaμ)Σ1(incógnitaμ)+kln(2π)]{\displaystyle \ln L({\boldsymbol {x}})=-{\frac {1}{2}}\left[\ln(|{\boldsymbol {\Sigma }}|\,)+({\boldsymbol {x}}-{\boldsymbol {\mu }})'{\boldsymbol {\Sigma }}^{-1}({\boldsymbol {x}}-{\boldsymbol {\mu }})+k\ln(2\pi )\right]},

La versión circularmente simétrica del caso complejo no central, dondez{\displaystyle {\boldsymbol {z}}}es un vector de números complejos, sería

lnL(z)=ln(|Σ|)(zμ)Σ1(zμ)kln(π){\displaystyle \ln L({\boldsymbol {z}})=-\ln(|{\boldsymbol {\Sigma }}|\,)-({\boldsymbol {z}}-{\boldsymbol {\mu }})^{\dagger }{\boldsymbol {\Sigma }}^{-1}({\boldsymbol {z}}-{\boldsymbol {\mu }})-k\ln(\pi )}

es decir, con la transpuesta conjugada (indicada por{\displaystyle \dagger }) reemplazando la transpuesta normal (indicada por{\displaystyle '}). Esto es ligeramente diferente al caso real, porque la versión circularmente simétrica de la distribución normal compleja tiene una forma ligeramente diferente para la constante de normalización .

Se utiliza una notación similar para la regresión lineal múltiple . [ 18 ]

Dado que la verosimilitud logarítmica de un vector normal es una forma cuadrática del vector normal, se distribuye como una variable chi-cuadrado generalizada .

entropía diferencial

La entropía diferencial de la distribución normal multivariada es [ 19 ]

h(F)=F(incógnita)lnF(incógnita)dincógnita=12ln|2πmiΣ|=k2(1+ln2π)+12ln|Σ|,{\displaystyle {\begin{aligned}h\left(f\right)&=-\int _{-\infty }^{\infty }\int _{-\infty }^{\infty }\cdots \int _{-\infty }^{\infty }f(\mathbf {x} )\ln f(\mathbf {x} )\,d\mathbf {x} \\[1ex]&={\frac {1}{2}}\ln \left|2\pi e{\boldsymbol {\Sigma }}\right|={\frac {k}{2}}\left(1+\ln 2\pi \right)+{\frac {1}{2}}\ln \left|{\boldsymbol {\Sigma }}\right|,\end{aligned}}}

donde las barras denotan el determinante de la matriz , k es la dimensionalidad del espacio vectorial y el resultado tiene unidades de nats .

Divergencia de Kullback-Leibler

La divergencia de Kullback-Leibler denorte1(μ1,Σ1){\displaystyle {\mathcal {N}}_{1}({\boldsymbol {\mu }}_{1},{\boldsymbol {\Sigma }}_{1})}anorte0(μ0,Σ0){\displaystyle {\mathcal {N}}_{0}({\boldsymbol {\mu }}_{0},{\boldsymbol {\Sigma }}_{0})}, para matrices no singulares Σ 1 y Σ 0 , es: [ 20 ]

DKL(norte0norte1)=12{tr(Σ11Σ0)+(μ1μ0)TΣ11(μ1μ0)k+ln|Σ1||Σ0|},{\displaystyle D_{\text{KL}}({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1})={1 \over 2}\left\{\operatorname {tr} \left({\boldsymbol {\Sigma }}_{1}^{-1}{\boldsymbol {\Sigma }}_{0}\right)+\left({\boldsymbol {\mu }}_{1}-{\boldsymbol {\mu }}_{0}\right)^{\rm {T}}{\boldsymbol {\Sigma }}_{1}^{-1}({\boldsymbol {\mu }}_{1}-{\boldsymbol {\mu }}_{0})-k+\ln {|{\boldsymbol {\Sigma }}_{1}| \over |{\boldsymbol {\Sigma }}_{0}|}\right\},}

dónde||{\displaystyle |\cdot |}denota el determinante de la matriz ,tr(){\displaystyle tr(\cdot )}es el rastro ,ln(){\displaystyle \ln(\cdot )}es el logaritmo natural yk{\displaystyle k}es la dimensión del espacio vectorial.

El logaritmo debe tomarse en base e, ya que los dos términos que siguen al logaritmo son a su vez logaritmos en base e de expresiones que son factores de la función de densidad o que surgen de forma natural. Por lo tanto, la ecuación da un resultado medido en nats . Dividiendo toda la expresión anterior por log   se obtiene la divergencia en bits .

Cuandoμ1=μ0{\displaystyle {\boldsymbol {\mu }}_{1}={\boldsymbol {\mu }}_{0}},

DKL(norte0norte1)=12{tr(Σ11Σ0)k+ln|Σ1||Σ0|}.{\displaystyle D_{\text{KL}}({\mathcal {N}}_{0}\parallel {\mathcal {N}}_{1})={1 \over 2}\left\{\operatorname {tr} \left({\boldsymbol {\Sigma }}_{1}^{-1}{\boldsymbol {\Sigma }}_{0}\right)-k+\ln {|{\boldsymbol {\Sigma }}_{1}| \over |{\boldsymbol {\Sigma }}_{0}|}\right\}.}

Información mutua

La información mutua de dos distribuciones normales multivariadas es un caso especial de la divergencia de Kullback-Leibler en la quePAG{\displaystyle P}es el completok{\displaystyle k}distribución multivariada dimensional yQ{\displaystyle Q}es el producto de lak1{\displaystyle k_{1}}yk2{\displaystyle k_{2}}distribuciones marginales dimensionalesincógnita{\displaystyle X}yY{\displaystyle Y}, de tal manera quek1+k2=k{\displaystyle k_{1}+k_{2}=k}. La información mutua entreincógnita{\displaystyle X}yY{\displaystyle Y}está dado por: [ 21 ]

I(incógnita,Y)=12ln(det(Σincógnita)det(ΣY)det(Σ)),{\displaystyle I({\boldsymbol {X}},{\boldsymbol {Y}})={\frac {1}{2}}\ln \left({\frac {\det(\Sigma _{X})\det(\Sigma _{Y})}{\det(\Sigma )}}\right),}

dónde

Σ=[ΣincógnitaΣincógnitaYΣincógnitaYΣY].{\displaystyle \Sigma ={\begin{bmatrix}\Sigma _{X}&\Sigma _{XY}\\\Sigma _{XY}&\Sigma _{Y}\end{bmatrix}}.}

SiQ{\displaystyle Q}es producto dek{\displaystyle k}distribuciones normales unidimensionales, luego en la notación de la sección de divergencia de Kullback-Leibler de este artículo,Σ1{\displaystyle {\boldsymbol {\Sigma }}_{1}}es una matriz diagonal con las entradas diagonales deΣ0{\displaystyle {\boldsymbol {\Sigma }}_{0}}, yμ1=μ0{\displaystyle {\boldsymbol {\mu }}_{1}={\boldsymbol {\mu }}_{0}}La fórmula resultante para la información mutua es:

I(incógnita)=12ln|ρ0|,{\displaystyle I({\boldsymbol {X}})=-{1 \over 2}\ln |{\boldsymbol {\rho }}_{0}|,}

dóndeρ0{\displaystyle {\boldsymbol {\rho }}_{0}}es la matriz de correlación construida a partir deΣ0{\displaystyle {\boldsymbol {\Sigma }}_{0}}. [ 22 ]

En el caso bivariado, la expresión para la información mutua es:

I(incógnita;y)=12ln(1ρ2).{\displaystyle I(x;y)=-{1 \over 2}\ln(1-\rho ^{2}).}

Normalidad articular

Distribuido normalmente e independiente

Siincógnita{\displaystyle X}yY{\displaystyle Y}están distribuidas normalmente y son independientes , esto implica que están "distribuidas conjuntamente normalmente", es decir, el par(incógnita,Y){\displaystyle (X,Y)}debe tener una distribución normal multivariada. Sin embargo, un par de variables distribuidas conjuntamente de forma normal no tienen por qué ser independientes (solo lo serían si no estuvieran correlacionadas,ρ=0{\displaystyle \rho =0}).

Dos variables aleatorias con distribución normal no tienen por qué ser bivariadas conjuntamente.

El hecho de que dos variables aleatoriasincógnita{\displaystyle X}yY{\displaystyle Y}El hecho de que ambos tengan una distribución normal no implica que el par(incógnita,Y){\displaystyle (X,Y)}tiene una distribución normal conjunta. Un ejemplo sencillo es aquel en el queincógnita{\displaystyle X}tiene una distribución normal con valor esperado 0 y varianza 1, yY=incógnita{\displaystyle Y=X}si|incógnita|>do{\displaystyle |X|>c}yY=incógnita{\displaystyle Y=-X}si|incógnita|<do{\displaystyle |X|<c}, dóndedo>0{\displaystyle c>0}Existen contraejemplos similares para más de dos variables aleatorias. En general, se combinan para formar un modelo de mezcla .

Correlaciones e independencia

En general, las variables aleatorias pueden no estar correlacionadas pero ser estadísticamente dependientes. Sin embargo, si un vector aleatorio tiene una distribución normal multivariada, entonces dos o más de sus componentes que no están correlacionadas son independientes . Esto implica que dos o más de sus componentes que son independientes entre sí también son independientes. Pero, como se señaló anteriormente, no es cierto que dos variables aleatorias que tienen una distribución normal ( por separado y marginalmente) y no están correlacionadas sean independientes.

Distribuciones condicionales

Si x N -dimensional se particiona de la siguiente manera

incógnita=[incógnita1incógnita2] con tamaños [q×1(norteq)×1]{\displaystyle \mathbf {x} ={\begin{bmatrix}\mathbf {x} _{1}\\\mathbf {x} _{2}\end{bmatrix}}{\text{ with sizes }}{\begin{bmatrix}q\times 1\\(N-q)\times 1\end{bmatrix}}}

y, en consecuencia, μ y Σ se dividen de la siguiente manera:

μ=[μ1μ2] con tamaños [q×1(norteq)×1]{\displaystyle {\boldsymbol {\mu }}={\begin{bmatrix}{\boldsymbol {\mu }}_{1}\\{\boldsymbol {\mu }}_{2}\end{bmatrix}}{\text{ with sizes }}{\begin{bmatrix}q\times 1\\(N-q)\times 1\end{bmatrix}}}
Σ=[Σ11Σ12Σ21Σ22] con tamaños [q×qq×(norteq)(norteq)×q(norteq)×(norteq)]{\displaystyle {\boldsymbol {\Sigma }}={\begin{bmatrix}{\boldsymbol {\Sigma }}_{11}&{\boldsymbol {\Sigma }}_{12}\\{\boldsymbol {\Sigma }}_{21}&{\boldsymbol {\Sigma }}_{22}\end{bmatrix}}{\text{ with sizes }}{\begin{bmatrix}q\times q&q\times (N-q)\\(N-q)\times q&(N-q)\times (N-q)\end{bmatrix}}}

entonces la distribución de x 1 condicionada a x 2 = a es normal multivariada [ 23 ] ( x 1  | x 2 = a ) ~ N ( μ , Σ )  donde

μ¯=μ1+Σ12Σ221(aμ2){\displaystyle {\bar {\boldsymbol {\mu }}}={\boldsymbol {\mu }}_{1}+{\boldsymbol {\Sigma }}_{12}{\boldsymbol {\Sigma }}_{22}^{-1}\left(\mathbf {a} -{\boldsymbol {\mu }}_{2}\right)}

y matriz de covarianza

Σ¯=Σ11Σ12Σ221Σ21.{\displaystyle {\overline {\boldsymbol {\Sigma }}}={\boldsymbol {\Sigma }}_{11}-{\boldsymbol {\Sigma }}_{12}{\boldsymbol {\Sigma }}_{22}^{-1}{\boldsymbol {\Sigma }}_{21}.}[ 24 ]

AquíΣ221{\displaystyle {\boldsymbol {\Sigma }}_{22}^{-1}}es la inversa generalizada deΣ22{\displaystyle {\boldsymbol {\Sigma }}_{22}}La matrizΣ¯{\displaystyle {\overline {\boldsymbol {\Sigma }}}}es el complemento de Schur de Σ 22 en Σ . Es decir, la ecuación anterior es equivalente a invertir la matriz de covarianza general, eliminar las filas y columnas correspondientes a las variables condicionadas y volver a invertirla para obtener la matriz de covarianza condicional.

Nótese que saber que x 2 = a altera la varianza, aunque la nueva varianza no depende del valor específico de a ; quizás más sorprendentemente, la media se desplaza enΣ12Σ221(aμ2){\displaystyle {\boldsymbol {\Sigma }}_{12}{\boldsymbol {\Sigma }}_{22}^{-1}\left(\mathbf {a} -{\boldsymbol {\mu }}_{2}\right)}; compárese esto con la situación de no conocer el valor de a , en cuyo caso x 1 tendría distribución norteq(μ1,Σ11){\displaystyle {\mathcal {N}}_{q}\left({\boldsymbol {\mu }}_{1},{\boldsymbol {\Sigma }}_{11}\right)}.

Un hecho interesante derivado para probar este resultado es que los vectores aleatoriosincógnita2{\displaystyle \mathbf {x} _{2}}yy1=incógnita1Σ12Σ221incógnita2{\displaystyle \mathbf {y} _{1}=\mathbf {x} _{1}-{\boldsymbol {\Sigma }}_{12}{\boldsymbol {\Sigma }}_{22}^{-1}\mathbf {x} _{2}}son independientes.

La matriz Σ 12 Σ 22 −1 se conoce como la matriz de coeficientes de regresión .

Caso bivariado

En el caso bivariado donde x se divide enincógnita1{\displaystyle X_{1}}yincógnita2{\displaystyle X_{2}}, la distribución condicional deincógnita1{\displaystyle X_{1}}dadoincógnita2{\displaystyle X_{2}}es [ 25 ]

incógnita1incógnita2=a  norte(μ1+σ1σ2ρ(aμ2),(1ρ2)σ12){\displaystyle X_{1}\mid X_{2}=a\ \sim \ {\mathcal {N}}\left(\mu _{1}+{\frac {\sigma _{1}}{\sigma _{2}}}\rho (a-\mu _{2}),\,(1-\rho ^{2})\sigma _{1}^{2}\right)}

dóndeρ=σ12σ1σ2{\displaystyle \rho ={\frac {\sigma _{12}}{\sigma _{1}\sigma _{2}}}}es el coeficiente de correlación entreincógnita1{\displaystyle X_{1}}yincógnita2{\displaystyle X_{2}}.

Esperanza condicional bivariada

En el caso general
(incógnita1incógnita2)norte((μ1μ2),(σ12ρσ1σ2ρσ1σ2σ22)){\displaystyle {\begin{pmatrix}X_{1}\\X_{2}\end{pmatrix}}\sim {\mathcal {N}}\left({\begin{pmatrix}\mu _{1}\\\mu _{2}\end{pmatrix}},{\begin{pmatrix}\sigma _{1}^{2}&\rho \sigma _{1}\sigma _{2}\\\rho \sigma _{1}\sigma _{2}&\sigma _{2}^{2}\end{pmatrix}}\right)}

La esperanza condicional de X 1 dado X 2 es:

mi(incógnita1incógnita2=incógnita2)=μ1+ρσ1σ2(incógnita2μ2){\displaystyle \operatorname {E} (X_{1}\mid X_{2}=x_{2})=\mu _{1}+\rho {\frac {\sigma _{1}}{\sigma _{2}}}(x_{2}-\mu _{2})}

Demostración: el resultado se obtiene tomando la esperanza de la distribución condicional.incógnita1incógnita2{\displaystyle X_{1}\mid X_{2}}arriba.

En el caso centrado con varianzas unitarias
(incógnita1incógnita2)norte((00),(1ρρ1)){\displaystyle {\begin{pmatrix}X_{1}\\X_{2}\end{pmatrix}}\sim {\mathcal {N}}\left({\begin{pmatrix}0\\0\end{pmatrix}},{\begin{pmatrix}1&\rho \\\rho &1\end{pmatrix}}\right)}

La esperanza condicional de X 1 dado X 2 es

mi(incógnita1incógnita2=incógnita2)=ρincógnita2{\displaystyle \operatorname {E} (X_{1}\mid X_{2}=x_{2})=\rho x_{2}}

y la varianza condicional es

var(incógnita1incógnita2=incógnita2)=1ρ2;{\displaystyle \operatorname {var} (X_{1}\mid X_{2}=x_{2})=1-\rho ^{2};}

por lo tanto, la varianza condicional no depende de x 2 .

La esperanza condicional de X 1 dado que X 2 es menor/mayor que z es: [ 26 ] : 367

mi(incógnita1incógnita2<z)=ρφ(z)Φ(z),{\displaystyle \operatorname {E} (X_{1}\mid X_{2}<z)=-\rho {\varphi (z) \over \Phi (z)},}
mi(incógnita1incógnita2>z)=ρφ(z)(1Φ(z)),{\displaystyle \operatorname {E} (X_{1}\mid X_{2}>z)=\rho {\varphi (z) \over (1-\Phi (z))},}

donde la relación final aquí se denomina relación inversa de Mills .

Prueba: los dos últimos resultados se obtienen utilizando el resultadomi(incógnita1incógnita2=incógnita2)=ρincógnita2{\displaystyle \operatorname {E} (X_{1}\mid X_{2}=x_{2})=\rho x_{2}}, de modo que

mi(incógnita1incógnita2<z)=ρmi(incógnita2incógnita2<z){\displaystyle \operatorname {E} (X_{1}\mid X_{2}<z)=\rho E(X_{2}\mid X_{2}<z)}y luego utilizando las propiedades de la esperanza de una distribución normal truncada .

Distribuciones marginales

Para obtener la distribución marginal sobre un subconjunto de variables aleatorias normales multivariadas, basta con eliminar las variables irrelevantes (las que se desean marginalizar) del vector de medias y la matriz de covarianza. La demostración se deduce de las definiciones de distribuciones normales multivariadas y del álgebra lineal. [ 27 ]

Ejemplo

Sea X = [ X 1 , X 2 , X 3 ] una variable aleatoria normal multivariada con vector de medias μ = [ μ 1 , μ 2 , μ 3 ] y matriz de covarianza Σ (parametrización estándar para distribuciones normales multivariadas). Entonces, la distribución conjunta de X = [ X 1 , X 3 ] es normal multivariada con vector de medias μ = [ μ 1 , μ 3 ] y matriz de covarianza Σ Σ=[Σ11Σ13Σ31Σ33]{\displaystyle {\boldsymbol {\Sigma }}'={\begin{bmatrix}{\boldsymbol {\Sigma }}_{11}&{\boldsymbol {\Sigma }}_{13}\\{\boldsymbol {\Sigma }}_{31}&{\boldsymbol {\Sigma }}_{33}\end{bmatrix}}}.

transformación afín

Si Y = c + BX es una transformación afín deincógnita norte(μ,Σ),{\displaystyle \mathbf {X} \ \sim {\mathcal {N}}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }}),}donde c es unMETRO×1{\displaystyle M\times 1}vector de constantes y B es una constanteMETRO×norte{\displaystyle M\times N}matriz, entonces Y tiene una distribución normal multivariada con valor esperado c + y varianza BΣB T es decir,Ynorte(do+Bμ,BΣBT){\displaystyle \mathbf {Y} \sim {\mathcal {N}}\left(\mathbf {c} +\mathbf {B} {\boldsymbol {\mu }},\mathbf {B} {\boldsymbol {\Sigma }}\mathbf {B} ^{\rm {T}}\right)}En particular, cualquier subconjunto de X i tiene una distribución marginal que también es normal multivariada. Para ver esto, considere el siguiente ejemplo: para extraer el subconjunto ( X 1 , X 2 , X 4 ) T , utilice

B=[100000010000000100]{\displaystyle \mathbf {B} ={\begin{bmatrix}1&0&0&0&0&\ldots &0\\0&1&0&0&0&\ldots &0\\0&0&0&1&0&\ldots &0\end{bmatrix}}}

que extrae directamente los elementos deseados.

Otro corolario es que la distribución de Z = b · X , donde b es un vector constante con el mismo número de elementos que X y el punto indica el producto escalar , es una distribución gaussiana univariada conZnorte(bμ,bTΣb){\displaystyle Z\sim {\mathcal {N}}\left(\mathbf {b} \cdot {\boldsymbol {\mu }},\mathbf {b} ^{\rm {T}}{\boldsymbol {\Sigma }}\mathbf {b} \right)}Este resultado se obtiene utilizando

B=[b1b2bnorte]=bT.{\displaystyle \mathbf {B} ={\begin{bmatrix}b_{1}&b_{2}&\ldots &b_{n}\end{bmatrix}}=\mathbf {b} ^{\rm {T}}.}

Observe cómo la positividad definida de Σ implica que la varianza del producto escalar debe ser positiva.

Una transformación afín de X como 2 X no es lo mismo que la suma de dos realizaciones independientes de X.

Interpretación geométrica

Los contornos de equidensidad de una distribución normal multivariada no singular son elipsoides (es decir, transformaciones afines de hiperesferas ) centrados en la media. [ 28 ] Por lo tanto, la distribución normal multivariada es un ejemplo de la clase de distribuciones elípticas . Las direcciones de los ejes principales de los elipsoides vienen dadas por los vectores propios de la matriz de covarianza.Σ{\displaystyle {\boldsymbol {\Sigma }}}Las longitudes relativas al cuadrado de los ejes principales vienen dadas por los autovalores correspondientes.

Si Σ = UΛU T = 1/2 ( 1/2 ) T es una descomposición en valores propios donde las columnas de U son vectores propios unitarios y Λ es una matriz diagonal de los valores propios, entonces tenemos

incógnita norte(μ,Σ)incógnita μ+UΛ1/2norte(0,I)incógnita μ+Unorte(0,Λ).{\displaystyle \mathbf {X} \ \sim {\mathcal {N}}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})\iff \mathbf {X} \ \sim {\boldsymbol {\mu }}+\mathbf {U} {\boldsymbol {\Lambda }}^{1/2}{\mathcal {N}}(0,\mathbf {I} )\iff \mathbf {X} \ \sim {\boldsymbol {\mu }}+\mathbf {U} {\mathcal {N}}(0,{\boldsymbol {\Lambda }}).}

Además, U puede elegirse como una matriz de rotación , ya que invertir un eje no tiene ningún efecto sobre N (0, Λ ), pero invertir una columna cambia el signo del determinante de U. La distribución N ( μ , Σ ) es en efecto N (0, I ) escalada por Λ 1/2 , rotada por U y trasladada por μ .

Por el contrario, cualquier elección de μ , matriz de rango completo U y entradas diagonales positivas Λ i produce una distribución normal multivariada no singular. Si algún Λ i es cero y U es cuadrada, la matriz de covarianza resultante UΛU T es singular . Geométricamente, esto significa que cada elipsoide de contorno es infinitamente delgado y tiene volumen cero en el espacio n -dimensional, ya que al menos uno de los ejes principales tiene longitud cero; este es el caso degenerado .

"El radio alrededor de la media verdadera en una variable aleatoria normal bivariada, reescrita en coordenadas polares (radio y ángulo), sigue una distribución de Hoyt ." [ 29 ]

En una dimensión, la probabilidad de encontrar una muestra de la distribución normal en el intervaloμ±σ{\displaystyle \mu \pm \sigma }es aproximadamente 68,27%, pero en dimensiones superiores la probabilidad de encontrar una muestra en la región de la elipse de desviación estándar es menor. [ 30 ]

Inferencia estadística

Estimación de parámetros

La derivación del estimador de máxima verosimilitud de la matriz de covarianza de una distribución normal multivariada es sencilla.

En resumen, la función de densidad de probabilidad (pdf) de una distribución normal multivariada es

F(incógnita)=1(2π)k|Σ|exp(12(incógnitaμ)TΣ1(incógnitaμ)){\displaystyle f(\mathbf {x} )={\frac {1}{\sqrt {(2\pi )^{k}|{\boldsymbol {\Sigma }}|}}}\exp \left(-{1 \over 2}(\mathbf {x} -{\boldsymbol {\mu }})^{\rm {T}}{\boldsymbol {\Sigma }}^{-1}({\mathbf {x} }-{\boldsymbol {\mu }})\right)}

y el estimador ML de la matriz de covarianza a partir de una muestra de n observaciones es [ 31 ]

Σ^=1nortei=1norte(incógnitaiincógnita¯)(incógnitaiincógnita¯)T{\displaystyle {\widehat {\boldsymbol {\Sigma }}}={1 \over n}\sum _{i=1}^{n}({\mathbf {x} }_{i}-{\overline {\mathbf {x} }})({\mathbf {x} }_{i}-{\overline {\mathbf {x} }})^{\mathrm {T} }}

que es simplemente la matriz de covarianza de la muestra . Este es un estimador sesgado cuya esperanza es

mi[Σ^]=norte1norteΣ.{\displaystyle E\left[{\widehat {\boldsymbol {\Sigma }}}\right]={\frac {n-1}{n}}{\boldsymbol {\Sigma }}.}

Una covarianza de muestra insesgada es

Σ^=1norte1i=1norte(incógnitaiincógnita¯)(incógnitaiincógnita¯)T=1norte1[incógnita(I1norteJ)incógnita]{\displaystyle {\widehat {\boldsymbol {\Sigma }}}={\frac {1}{n-1}}\sum _{i=1}^{n}(\mathbf {x} _{i}-{\overline {\mathbf {x} }})(\mathbf {x} _{i}-{\overline {\mathbf {x} }})^{\rm {T}}={\frac {1}{n-1}}\left[X'\left(I-{\frac {1}{n}}\cdot J\right)X\right]} (forma matricial;I{\displaystyle I}es elK×K{\displaystyle K\times K}matriz identidad, J es unaK×K{\displaystyle K\times K}matriz de unos; el término entre paréntesis es, por lo tanto, elK×K{\displaystyle K\times K}matriz de centrado)

La matriz de información de Fisher para estimar los parámetros de una distribución normal multivariada tiene una expresión analítica. Esta puede utilizarse, por ejemplo, para calcular la cota de Cramér-Rao para la estimación de parámetros en este contexto. Consulte la información de Fisher para obtener más detalles.

Inferencia bayesiana

En estadística bayesiana , la distribución a priori conjugada del vector de medias es otra distribución normal multivariada, y la distribución a priori conjugada de la matriz de covarianza es una distribución inversa de Wishart.W1{\displaystyle {\mathcal {W}}^{-1}}Supongamos entonces que se han realizado n observaciones.

incógnita={incógnita1,,incógnitanorte}norte(μ,Σ){\displaystyle \mathbf {X} =\{\mathbf {x} _{1},\dots ,\mathbf {x} _{n}\}\sim {\mathcal {N}}({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})}

y que se ha asignado un prior conjugado, donde

pag(μ,Σ)=pag(μΣ) pag(Σ),{\displaystyle p({\boldsymbol {\mu }},{\boldsymbol {\Sigma }})=p({\boldsymbol {\mu }}\mid {\boldsymbol {\Sigma }})\ p({\boldsymbol {\Sigma }}),}

dónde

pag(μΣ)norte(μ0,metro1Σ),{\displaystyle p({\boldsymbol {\mu }}\mid {\boldsymbol {\Sigma }})\sim {\mathcal {N}}({\boldsymbol {\mu }}_{0},m^{-1}{\boldsymbol {\Sigma }}),}

y

pag(Σ)W1(Ψ,norte0).{\displaystyle p({\boldsymbol {\Sigma }})\sim {\mathcal {W}}^{-1}({\boldsymbol {\Psi }},n_{0}).}

Entonces [ 31 ]

pag(μΣ,incógnita)norte(norteincógnita¯+metroμ0norte+metro,1norte+metroΣ),pag(Σincógnita)W1(Ψ+norteS+nortemetronorte+metro(incógnita¯μ0)(incógnita¯μ0),norte+norte0),{\displaystyle {\begin{array}{rcl}p({\boldsymbol {\mu }}\mid {\boldsymbol {\Sigma }},\mathbf {X} )&\sim &{\mathcal {N}}\left({\frac {n{\bar {\mathbf {x} }}+m{\boldsymbol {\mu }}_{0}}{n+m}},{\frac {1}{n+m}}{\boldsymbol {\Sigma }}\right),\\p({\boldsymbol {\Sigma }}\mid \mathbf {X} )&\sim &{\mathcal {W}}^{-1}\left({\boldsymbol {\Psi }}+n\mathbf {S} +{\frac {nm}{n+m}}({\bar {\mathbf {x} }}-{\boldsymbol {\mu }}_{0})({\bar {\mathbf {x} }}-{\boldsymbol {\mu }}_{0})',n+n_{0}\right),\end{array}}}

dónde

incógnita¯=1nortei=1norteincógnitai,S=1nortei=1norte(incógnitaiincógnita¯)(incógnitaiincógnita¯).{\displaystyle {\begin{aligned}{\bar {\mathbf {x} }}&={\frac {1}{n}}\sum _{i=1}^{n}\mathbf {x} _{i},\\\mathbf {S} &={\frac {1}{n}}\sum _{i=1}^{n}(\mathbf {x} _{i}-{\bar {\mathbf {x} }})(\mathbf {x} _{i}-{\bar {\mathbf {x} }})'.\end{aligned}}}

Pruebas de normalidad multivariadas

Las pruebas de normalidad multivariante comprueban si un conjunto de datos dado se asemeja a la distribución normal multivariante . La hipótesis nula es que el conjunto de datos es similar a la distribución normal; por lo tanto, un valor p suficientemente pequeño indica que los datos no son normales. Las pruebas de normalidad multivariante incluyen la prueba de Cox-Small [ 32 ] y la adaptación de Smith y Jain [ 33 ] de la prueba de Friedman-Rafsky creada por Larry Rafsky y Jerome Friedman [ 34 ] .

La prueba de Mardia

La prueba de Mardia [ 35 ] se basa en extensiones multivariadas de las medidas de asimetría y curtosis . Para una muestra { x1 , ..., xn } de vectores k -dimensionales calculamos

Σ^=1nortej=1norte(incógnitajincógnita¯)(incógnitajincógnita¯)TA=16nortei=1nortej=1norte[(incógnitaiincógnita¯)TΣ^1(incógnitajincógnita¯)]3B=norte8k(k+2){1nortei=1norte[(incógnitaiincógnita¯)TΣ^1(incógnitaiincógnita¯)]2k(k+2)}{\displaystyle {\begin{aligned}&{\widehat {\boldsymbol {\Sigma }}}={1 \over n}\sum _{j=1}^{n}\left(\mathbf {x} _{j}-{\bar {\mathbf {x} }}\right)\left(\mathbf {x} _{j}-{\bar {\mathbf {x} }}\right)^{\mathrm {T} }\\&A={1 \over 6n}\sum _{i=1}^{n}\sum _{j=1}^{n}\left[(\mathbf {x} _{i}-{\bar {\mathbf {x} }})^{\mathrm {T} }\;{\widehat {\boldsymbol {\Sigma }}}^{-1}(\mathbf {x} _{j}-{\bar {\mathbf {x} }})\right]^{3}\\&B={\sqrt {\frac {n}{8k(k+2)}}}\left\{{1 \over n}\sum _{i=1}^{n}\left[(\mathbf {x} _{i}-{\bar {\mathbf {x} }})^{\mathrm {T} }\;{\widehat {\boldsymbol {\Sigma }}}^{-1}(\mathbf {x} _{i}-{\bar {\mathbf {x} }})\right]^{2}-k(k+2)\right\}\end{aligned}}}

Bajo la hipótesis nula de normalidad multivariada, el estadístico A tendrá aproximadamente una distribución chi-cuadrado con 1 / 6k ( k + 1)( k + 2) grados de libertad, y B será aproximadamente normal estándar N (0,1).

El estadístico de curtosis de Mardia es asimétrico y converge muy lentamente a la distribución normal límite. Para muestras de tamaño medio(50norte<400){\displaystyle (50\leq n<400)}, los parámetros de la distribución asintótica del estadístico de curtosis se modifican [ 36 ] Para pruebas de muestras pequeñas (norte<50{\displaystyle n<50}) se utilizan valores críticos empíricos. Rencher [ 37 ] proporciona tablas de valores críticos para ambas estadísticas para k  =  2,  3,  4.

Las pruebas de Mardia son invariantes afines pero no consistentes. Por ejemplo, la prueba de asimetría multivariante no es consistente frente a alternativas no normales simétricas. [ 38 ]

Prueba BHEP

La prueba BHEP [ 39 ] calcula la norma de la diferencia entre la función característica empírica y la función característica teórica de la distribución normal. El cálculo de la norma se realiza en el espacio L2 ( μ ) de funciones de cuadrado integrable con respecto a la función de ponderación gaussiana .μβ(t)=(2πβ2)k/2mi|t|2/(2β2){\displaystyle \mu _{\beta }(\mathbf {t} )=(2\pi \beta ^{2})^{-k/2}e^{-|\mathbf {t} |^{2}/(2\beta ^{2})}}El estadístico de prueba es

Tβ=Rk|1nortej=1nortemiitTΣ^1/2(incógnitajincógnita)¯mi|t|2/2|2μβ(t)dt=1norte2i,j=1nortemiβ22(incógnitaiincógnitaj)TΣ^1(incógnitaiincógnitaj)2norte(1+β2)k/2i=1nortemiβ22(1+β2)(incógnitaiincógnita¯)TΣ^1(incógnitaiincógnita¯)+1(1+2β2)k/2{\displaystyle {\begin{aligned}T_{\beta }&=\int _{\mathbb {R} ^{k}}\left|{1 \over n}\sum _{j=1}^{n}e^{i\mathbf {t} ^{\mathrm {T} }{\widehat {\boldsymbol {\Sigma }}}^{-1/2}(\mathbf {x} _{j}-{\bar {\mathbf {x} )}}}-e^{-|\mathbf {t} |^{2}/2}\right|^{2}\;{\boldsymbol {\mu }}_{\beta }(\mathbf {t} )\,d\mathbf {t} \\&={1 \over n^{2}}\sum _{i,j=1}^{n}e^{-{\beta ^{2} \over 2}(\mathbf {x} _{i}-\mathbf {x} _{j})^{\mathrm {T} }{\widehat {\boldsymbol {\Sigma }}}^{-1}(\mathbf {x} _{i}-\mathbf {x} _{j})}-{\frac {2}{n(1+\beta ^{2})^{k/2}}}\sum _{i=1}^{n}e^{-{\frac {\beta ^{2}}{2(1+\beta ^{2})}}(\mathbf {x} _{i}-{\bar {\mathbf {x} }})^{\mathrm {T} }{\widehat {\boldsymbol {\Sigma }}}^{-1}(\mathbf {x} _{i}-{\bar {\mathbf {x} }})}+{\frac {1}{(1+2\beta ^{2})^{k/2}}}\end{aligned}}}

La distribución límite de este estadístico de prueba es una suma ponderada de variables aleatorias chi-cuadrado. [ 39 ]

Se encuentra disponible un estudio detallado de estos y otros procedimientos de prueba. [ 40 ]

Métodos computacionales

Extraer valores de la distribución

Un método ampliamente utilizado para extraer (muestrear) un vector aleatorio x de la distribución normal multivariada N -dimensional con vector de media μ y matriz de covarianza Σ funciona de la siguiente manera: [ 41 ]

  1. Encuentra cualquier matriz real A tal que AA T = Σ . Cuando Σ es definida positiva, se suele utilizar la descomposición de Cholesky porque está ampliamente disponible, es computacionalmente eficiente y es bien conocida. Si se dispone de una descomposición de Cholesky que revele el rango (pivotada), como dpstrf() de LAPACK, también se puede utilizar en el caso general de semidefinida positiva. Una alternativa general más lenta es utilizar la matriz A = 1/2 obtenida de una descomposición espectral Σ = UΛU −1 de Σ .
  2. Sea z = ( z 1 , ..., z N ) T un vector cuyos componentes son N variables aleatorias normales estándar independientes (que se pueden generar, por ejemplo, utilizando la transformada de Box-Muller ).
  3. Sea x = μ + Az . Esto tiene la distribución deseada debido a la propiedad de transformación afín.

Véase también

Referencias

  1. 1 2 3 Lapidoth, Amos (2009). Fundamentos de la comunicación digital . Cambridge University Press. ISBN 978-0-521-19395-5.
  2. Gut, Allan (2009). Un curso intermedio de probabilidad . Springer. ISBN 978-1-441-90161-3.
  3. Kac, M. (1939). "Sobre una caracterización de la distribución normal". American Journal of Mathematics . 61 (3): 726– 728. doi : 10.2307/2371328 . JSTOR 2371328 . 
  4. Sinz, Fabian; Gerwinn, Sebastian; Bethge, Matthias (2009). "Caracterización de la distribución normal generalizada p" . Journal of Multivariate Analysis . 100 (5): 817– 820. doi : 10.1016/j.jmva.2008.07.006 .
  5. Simon JD Prince (junio de 2012). Visión por computadora: modelos, aprendizaje e inferencia. Archivado el 28 de octubre de 2020 en Wayback Machine . Cambridge University Press. 3.7: "Distribución normal multivariada".
  6. Kim, M. G. (2000). "Valores atípicos multivariados y descomposiciones de la distancia de Mahalanobis". Communications in Statistics – Theory and Methods . 29 (7): 1511– 1526. doi : 10.1080/03610920008832559 . 
  7. Hamedani, GG; Tata, MN (1975). "Sobre la determinación de la distribución normal bivariada a partir de distribuciones de combinaciones lineales de las variables". The American Mathematical Monthly . 82 (9): 913– 915. doi : 10.2307/2318494 . JSTOR 2318494 . 
  8. Wyatt, John (26 de noviembre de 2008). "Estimación lineal de mínimos cuadrados medios" (PDF) . Apuntes de clase del curso de probabilidad aplicada . Archivado del original (PDF) el 10 de octubre de 2015. Recuperado el 23 de enero de 2012 .
  9. "álgebra lineal - Mapeo entre funciones de coordenadas afines" . Mathematics Stack Exchange . Consultado el 24 de junio de 2022 .
  10. Rao, CR (1973). Inferencia estadística lineal y sus aplicaciones . Nueva York: Wiley. págs. 527–528 . ISBN  0-471-70823-2.
  11. 1 2 Botev, ZI (2016). "La ley normal bajo restricciones lineales: simulación y estimación mediante inclinación minimax". Journal of the Royal Statistical Society, Serie B. 79 : 125–148 . arXiv : 1603.04166 . Bibcode : 2016arXiv160304166B . doi : 10.1111 /rssb.12162 . S2CID 88515228 . 
  12. Genz, Alan (2009). Cálculo de probabilidades normales y t multivariadas . Springer. ISBN 978-3-642-01689-9.
  13. 1 2 Bensimhoun Michael, Función acumulativa N-dimensional y otros datos útiles sobre gaussianas y densidades normales (2006)
  14. Siotani, Minoru (1964). "Regiones de tolerancia para una población normal multivariada" (PDF) . Anales del Instituto de Matemáticas Estadísticas . 16 (1): 135– 153. doi : 10.1007/BF02868568 . S2CID 123269490 . 
  15. 1 2 Botev, ZI; Mandjes, M.; Ridder, A. (6–9 de diciembre de 2015). "Distribución de la cola del máximo de variables aleatorias gaussianas correlacionadas". Conferencia de Simulación de Invierno de 2015 (WSC) . Huntington Beach, California, EE. UU.: IEEE. págs. 633–642 . doi : 10.1109/WSC.2015.7408202 . hdl : 10419/130486 . ISBN  978-1-4673-9743-8.
  16. Adler, RJ; Blanchet, J.; Liu, J. (7–10 dic. 2008). "Simulación eficiente para probabilidades de cola de campos aleatorios gaussianos". 2008 Winter Simulation Conference (WSC) . Miami, Fla., EE. UU.: IEEE. pp. 328–336 . doi : 10.1109/WSC.2008.4736085 . ISBN  978-1-4244-2707-9.
  17. Hernandez-Stumpfhauser, Daniel; Breidt, F. Jay; van der Woerd, Mark J. (2017). "La distribución normal proyectada general de dimensión arbitraria: modelado e inferencia bayesiana" . Análisis bayesiano . 12 (1): 113– 133. doi : 10.1214/15-BA989 .
  18. Tong, T. (2010) Regresión lineal múltiple  : MLE y sus resultados de distribución Archivado el 16-06-2013 en WebCite , Notas de clase
  19. Gokhale, DV; Ahmed, NA; Res, BC; Piscataway, NJ (mayo de 1989). "Expresiones de entropía y sus estimadores para distribuciones multivariadas". IEEE Transactions on Information Theory . 35 (3): 688– 692. doi : 10.1109/18.30996 .
  20. Duchi, J. Derivaciones para álgebra lineal y optimización (PDF) (Tesis). pág. 13. Archivado del original (PDF) el 25 de julio de 2020. Consultado el 12 de agosto de 2020 . 
  21. Demostración: Información mutua de la distribución normal multivariada
  22. MacKay, David JC (6 de octubre de 2003). Teoría de la información, inferencia y algoritmos de aprendizaje ( Edición ilustrada). Cambridge: Cambridge University Press. ISBN  978-0-521-64298-9.
  23. Holt, W.; Nguyen, D. (2023). Aspectos esenciales de la imputación de datos bayesiana (Tesis). SSRN 4494314 . 
  24. Eaton, Morris L. (1983). Multivariate Statistics: a Vector Space Approach . John Wiley and Sons. pp. 116–117 . ISBN  978-0-471-02776-8.
  25. Jensen, J (2000). Estadística para ingenieros petroleros y geocientíficos . Ámsterdam: Elsevier. pág. 207. ISBN  0-444-50552-0.
  26. Maddala, GS (1983). Variables dependientes limitadas y cualitativas en econometría . Cambridge University Press. ISBN 0-521-33825-5.
  27. Aquí se muestra un cálculo algebraico de la distribución marginal: http://fourier.eng.hmc.edu/e161/lectures/gaussianprocess/node7.html. Archivado el 17 de enero de 2010 en Wayback Machine . Una demostración mucho más breve se describe aquí : https://math.stackexchange.com/a/3832137
  28. Nikolaus Hansen (2016). "La estrategia de evolución de CMA: un tutorial" (PDF) . arXiv : 1604.00772 . Bibcode : 2016arXiv160400772H . Archivado del original (PDF) el 31 de marzo de 2010. Consultado el 7 de enero de 2012 .
  29. Daniel Wollschlaeger. "La distribución de Hoyt (Documentación para el paquete de R 'shotGroups' versión 0.6.2)" .
  30. Wang, Bin; Shi, Wenzhong; Miao, Zelang (2015-03-13). Rocchini, Duccio (ed.). "Análisis de confianza de la elipse de desviación estándar y su extensión al espacio euclidiano de dimensiones superiores" . PLOS ONE . 10 (3) e0118537. Bibcode : 2015PLoSO..1018537W . doi : 10.1371/journal.pone.0118537 . ISSN 1932-6203 . PMC 4358977. PMID 25769048 .   
  31. 1 2 Holt, W.; Nguyen, D. (2023). Introducción a la imputación de datos bayesiana (tesis). SSRN 4494314 . 
  32. Cox, DR; Small, NJH (1978). "Prueba de normalidad multivariante". Biometrika . 65 (2): 263. doi : 10.1093/biomet/65.2.263 .
  33. Smith, SP; Jain, AK (1988). "Una prueba para determinar la normalidad multivariada de un conjunto de datos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 10 (5): 757. doi : 10.1109/34.6789 .
  34. Friedman, JH; Rafsky, LC (1979). "Generalizaciones multivariadas de las pruebas de dos muestras de Wald-Wolfowitz y Smirnov" . The Annals of Statistics . 7 (4): 697. doi : 10.1214/aos/1176344722 .
  35. Mardia, KV (1970). "Medidas de asimetría y curtosis multivariadas con aplicaciones". Biometrika . 57 (3): 519– 530. doi : 10.1093/biomet/57.3.519 .
  36. Rencher (1995), páginas 112–113.
  37. Rencher (1995), páginas 493–495.
  38. Baringhaus, L.; Henze, N. (1991). "Distribuciones límite para medidas de asimetría y curtosis multivariadas basadas en proyecciones" . Journal of Multivariate Analysis . 38 : 51–69 . doi : 10.1016/0047-259X(91)90031-V .
  39. 1 2 Baringhaus, L.; Henze, N. (1988). "Una prueba consistente para la normalidad multivariada basada en la función característica empírica". Metrika . 35 (1): 339– 348. doi : 10.1007/BF02613322 . S2CID 122362448 . 
  40. Henze, Norbert (2002). "Pruebas invariantes para la normalidad multivariante: una revisión crítica". Statistical Papers . 43 (4): 467– 506. doi : 10.1007/s00362-002-0119-6 . S2CID 122934510 . 
  41. Gentle, JE (2009). Estadística computacional . Estadística y computación. Nueva York: Springer. págs. 315–316 . doi : 10.1007/978-0-387-98144-4 . ISBN  978-0-387-98143-7.

Literatura

  • Rencher, AC (1995). Métodos de análisis multivariante . Nueva York: Wiley.
  • Tong, YL (1990). La distribución normal multivariada . Springer Series in Statistics. Nueva York: Springer-Verlag. doi : 10.1007/978-1-4613-9655-0 . ISBN 978-1-4613-9657-4. S2CID 120348131 .