Articulo de referencia

Media y covarianza de la muestra

La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestr...

La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestra de datos sobre una o más variables aleatorias .

La media muestral es el valor promedio (o media ) de una muestra de números extraída de una población mayor , donde "población" se refiere no al número de personas, sino a la totalidad de los datos relevantes, ya sean recopilados o no. Por conveniencia, se puede utilizar una muestra de las ventas de 40 empresas de la lista Fortune 500 en lugar de analizar la población, es decir, las ventas de las 500 empresas. La media muestral se utiliza como estimador de la media poblacional, el valor promedio de toda la población, y es más probable que la estimación se aproxime a la media poblacional si la muestra es grande y representativa. La fiabilidad de la media muestral se estima mediante el error estándar , que a su vez se calcula utilizando la varianza de la muestra. Si la muestra es aleatoria, el error estándar disminuye con el tamaño de la muestra y la distribución de la media muestral se aproxima a la distribución normal a medida que aumenta el tamaño de la muestra.

El término "media muestral" también puede referirse a un vector de valores promedio cuando el estadístico analiza los valores de varias variables en la muestra, por ejemplo, las ventas, las ganancias y el número de empleados de una muestra de empresas Fortune 500. En este caso, no solo se dispone de la varianza muestral para cada variable, sino también de una matriz de covarianza muestral (o simplemente matriz de covarianza ) que muestra la relación entre cada par de variables. Esta sería una matriz de 3×3 cuando se consideran tres variables. La covarianza muestral es útil para evaluar la fiabilidad de las medias muestrales como estimadores y también como estimación de la matriz de covarianza poblacional.

Debido a su facilidad de cálculo y otras características deseables, la media muestral y la covarianza muestral se utilizan ampliamente en estadística para representar la ubicación y la dispersión de la distribución de valores en la muestra, y para estimar los valores de la población.

Definición de la media muestral

La media muestral es el promedio de los valores de una variable en una muestra, que es la suma de esos valores dividida por el número de valores. Utilizando notación matemática , si se toma una muestra de N observaciones de la variable X de la población, la media muestral es:

incógnita¯=1nortei=1norteincógnitai.{\displaystyle {\bar {X}}={\frac {1}{N}}\sum _{i=1}^{N}X_{i}.}

Según esta definición, si la muestra (1, 4, 1) se toma de la población (1,1,3,4,0,2,1,0), entonces la media de la muestra esincógnita¯=(1+4+1)/3=2{\displaystyle {\bar {x}}=(1+4+1)/3=2}, en comparación con la media poblacional deμ=(1+1+3+4+0+2+1+0)/8=12/8=1.5{\displaystyle \mu =(1+1+3+4+0+2+1+0)/8=12/8=1.5}Aunque una muestra sea aleatoria, rara vez es perfectamente representativa, y otras muestras tendrían medias diferentes incluso si todas provinieran de la misma población. La muestra (2, 1, 0), por ejemplo, tendría una media de 1.

Si el estadístico está interesado en K variables en lugar de una, y cada observación tiene un valor para cada una de esas K variables, la media muestral general consta de K medias muestrales para variables individuales.incógnitaij{\displaystyle x_{ij}}sea ​​la i -ésima observación extraída independientemente ( i = 1, ..., N ) de la j -ésima variable aleatoria ( j = 1, ..., K ). Estas observaciones se pueden organizar en N vectores columna, cada uno con K entradas, donde el vector columna K × 1 que da las i -ésimas observaciones de todas las variables se denotaincógnitai{\displaystyle \mathbf {x} _{i}}( i =1,..., N ).

El vector de media muestralincógnita¯{\displaystyle \mathbf {\bar {x}} }es un vector columna cuyo j -ésimo elementoincógnita¯j{\displaystyle {\bar {x}}_{j}}es el valor promedio de las N observaciones de la j -ésima variable:

incógnita¯j=1nortei=1norteincógnitaij,j=1,,K.{\displaystyle {\bar {x}}_{j}={\frac {1}{N}}\sum _{i=1}^{N}x_{ij},\quad j=1,\ldots ,K.}

Así, el vector de media muestral contiene el promedio de las observaciones para cada variable y se escribe

incógnita¯=1nortei=1norteincógnitai=[incógnita¯1incógnita¯jincógnita¯K]{\displaystyle \mathbf {\bar {x}} ={\frac {1}{N}}\sum _{i=1}^{N}\mathbf {x} _{i}={\begin{bmatrix}{\bar {x}}_{1}\\\vdots \\{\bar {x}}_{j}\\\vdots \\{\bar {x}}_{K}\end{bmatrix}}}

Definición de covarianza muestral

La matriz de covarianza muestral es una matriz de K por K.Q=[qjk]{\displaystyle \textstyle \mathbf {Q} =\left[q_{jk}\right]}con entradas

qjk=1norte1i=1norte(incógnitaijincógnita¯j)(incógnitaikincógnita¯k),{\displaystyle q_{jk}={\frac {1}{N-1}}\sum _{i=1}^{N}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right),}

dóndeqjk{\displaystyle q_{jk}}es una estimación de la covarianza entre la j -ésima variable y la k -ésima variable de la población subyacente a los datos. En términos de los vectores de observación, la covarianza muestral es

Q=1norte1i=1norte(incógnitai.incógnita¯)(incógnitai.incógnita¯)T,{\displaystyle \mathbf {Q} ={1 \over {N-1}}\sum _{i=1}^{N}(\mathbf {x} _{i}.-\mathbf {\bar {x}} )(\mathbf {x} _{i}.-\mathbf {\bar {x}} )^{\mathrm {T} },}

Alternativamente, se pueden organizar los vectores de observación como las columnas de una matriz, de modo que

F=[incógnita1incógnita2incógnitanorte]{\displaystyle \mathbf {F} ={\begin{bmatrix}\mathbf {x} _{1}&\mathbf {x} _{2}&\dots &\mathbf {x} _{N}\end{bmatrix}}},

que es una matriz de K filas y N columnas. Aquí, la matriz de covarianza muestral se puede calcular como

Q=1norte1(Fincógnita¯1norteT)(Fincógnita¯1norteT)T{\displaystyle \mathbf {Q} ={\frac {1}{N-1}}(\mathbf {F} -\mathbf {\bar {x}} \,\mathbf {1} _{N}^{\mathrm {T} })(\mathbf {F} -\mathbf {\bar {x}} \,\mathbf {1} _{N}^{\mathrm {T} })^{\mathrm {T} }},

dónde1norte{\displaystyle \mathbf {1} _{N}}es un vector de unos de N por 1. Si las observaciones se organizan en filas en lugar de columnas, entoncesincógnita¯{\displaystyle \mathbf {\bar {x}} }ahora es un vector fila de 1× K yMETRO=FT{\displaystyle \mathbf {M} =\mathbf {F} ^{\mathrm {T} }}es una matriz N × K cuya columna j es el vector de N observaciones de la variable j , entonces al aplicar transposiciones en los lugares apropiados se obtiene

Q=1norte1(METRO1norteincógnita¯)T(METRO1norteincógnita¯).{\displaystyle \mathbf {Q} ={\frac {1}{N-1}}(\mathbf {M} -\mathbf {1} _{N}\mathbf {\bar {x}} )^{\mathrm {T} }(\mathbf {M} -\mathbf {1} _{N}\mathbf {\bar {x}} ).}

Al igual que las matrices de covarianza para vectores aleatorios , las matrices de covarianza de muestra son semidefinidas positivas . Para demostrarlo, observe que para cualquier matrizA{\displaystyle \mathbf {A} }la matrizATA{\displaystyle \mathbf {A} ^{T}\mathbf {A} }es semidefinida positiva. Además, una matriz de covarianza es definida positiva si y solo si el rango de laincógnitai.incógnita¯{\displaystyle \mathbf {x} _{i}.-\mathbf {\bar {x}} }Los vectores son K.

Imparcialidad

La media muestral y la matriz de covarianza muestral son estimaciones insesgadas de la media y la matriz de covarianza del vector aleatorio.incógnita{\displaystyle \textstyle \mathbf {X} }, un vector fila cuyo j -ésimo elemento ( j = 1, ..., K ) es una de las variables aleatorias. [ 1 ] La matriz de covarianza muestral tienenorte1{\displaystyle \textstyle N-1}en el denominador en lugar denorte{\displaystyle \textstyle N}debido a una variante de la corrección de Bessel : En resumen, la covarianza muestral se basa en la diferencia entre cada observación y la media muestral, pero la media muestral está ligeramente correlacionada con cada observación ya que se define en términos de todas las observaciones. Si la media poblacionalmi(incógnita){\displaystyle \operatorname {E} (\mathbf {X} )}Se conoce la estimación análoga insesgada.

qjk=1nortei=1norte(incógnitaijmi(incógnitaj))(incógnitaikmi(incógnitak)),{\displaystyle q_{jk}={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{ij}-\operatorname {E} (X_{j})\right)\left(x_{ik}-\operatorname {E} (X_{k})\right),}

utilizando la media poblacional, tienenorte{\displaystyle \textstyle N}en el denominador. Este es un ejemplo de por qué en probabilidad y estadística es esencial distinguir entre variables aleatorias (letras mayúsculas) y realizaciones de las variables aleatorias (letras minúsculas).

La estimación de máxima verosimilitud de la covarianza

qjk=1nortei=1norte(incógnitaijincógnita¯j)(incógnitaikincógnita¯k){\displaystyle q_{jk}={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right)}

En el caso de la distribución gaussiana, N también está en el denominador. La razón de 1/ N a 1/( N 1) se aproxima a 1 para valores grandes de N , por lo que la estimación de máxima verosimilitud es aproximadamente igual a la estimación insesgada cuando la muestra es grande.   

Distribución de la media muestral

For each random variable, the sample mean is a good estimator of the population mean, where a "good" estimator is defined as being efficient and unbiased. Of course the estimator will likely not be the true value of the population mean since different samples drawn from the same distribution will give different sample means and hence different estimates of the true mean. Thus the sample mean is a random variable, not a constant, and consequently has its own distribution.

Denoting with μ the population mean and with σ2{\displaystyle \sigma ^{2}} the population variance, for a random sample of nindependent observations drawn from the population, the expected value of the sample mean is

E(x¯)=μ{\displaystyle \operatorname {E} ({\bar {x}})=\mu }

and the variance of the sample mean is

var(x¯)=σ2n.{\displaystyle \operatorname {var} ({\bar {x}})={\frac {\sigma ^{2}}{n}}.}

If the samples are not independent, but correlated, then special care has to be taken in order to avoid the problem of pseudoreplication.

If the population is normally distributed, then the sample mean is normally distributed as follows:

x¯N{μ,σ2n}.{\displaystyle {\bar {x}}\thicksim N\left\{\mu ,{\frac {\sigma ^{2}}{n}}\right\}.}

If the population is not normally distributed, the sample mean is nonetheless approximately normally distributed if n is large and σ2/n < +∞. This is a consequence of the central limit theorem.

Weighted samples

In a weighted sample, each vector xi{\displaystyle \textstyle {\textbf {x}}_{i}} (each set of single observations on each of the K random variables) is assigned a weight wi0{\displaystyle \textstyle w_{i}\geq 0}. Without loss of generality, assume that the weights are normalized:

i=1Nwi=1.{\displaystyle \sum _{i=1}^{N}w_{i}=1.}

(If they are not, divide the weights by their sum). Then the weighted mean vector x¯{\displaystyle \textstyle \mathbf {\bar {x}} } is given by

x¯=i=1Nwixi.{\displaystyle \mathbf {\bar {x}} =\sum _{i=1}^{N}w_{i}\mathbf {x} _{i}.}

and the elements qjk{\displaystyle q_{jk}} of the weighted covariance matrix Q{\displaystyle \textstyle \mathbf {Q} } are [2]

qjk=11i=1Nwi2i=1Nwi(xijx¯j)(xikx¯k).{\displaystyle q_{jk}={\frac {1}{1-\sum _{i=1}^{N}w_{i}^{2}}}\sum _{i=1}^{N}w_{i}\left(x_{ij}-{\bar {x}}_{j}\right)\left(x_{ik}-{\bar {x}}_{k}\right).}

If all weights are the same, wi=1/N{\displaystyle \textstyle w_{i}=1/N}, the weighted mean and covariance reduce to the (biased) sample mean and covariance mentioned above.

Criticism

The sample mean and sample covariance are not robust statistics, meaning that they are sensitive to outliers. As robustness is often a desired trait, particularly in real-world applications, robust alternatives may prove desirable, notably quantile-based statistics such as the sample median for location,[3] and interquartile range (IQR) for dispersion. Other alternatives include trimming and Winsorising, as in the trimmed mean and the Winsorized mean.

See also

Referencias

  1. Richard Arnold Johnson; Dean W. Wichern (2007). Análisis estadístico multivariante aplicado . Pearson Prentice Hall. ISBN 978-0-13-187715-3Consultado el 10 de agosto de 2012 .
  2. Mark Galassi, Jim Davies, James Theiler, Brian Gough, Gerard Jungman, Michael Booth y Fabrice Rossi. Biblioteca Científica GNU - Manual de referencia, Versión 2.6 , 2021. Sección Estadísticas: Muestras ponderadas
  3. The World Question Center 2006: La media muestral Archivado el 12/07/2019 en Wayback Machine , Bart Kosko
Obtenido de " https://en.wikipedia.org/w/index.php?title=Sample_mean_and_covariance&oldid=1312676784 "