La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestra de datos sobre una o más variables aleatorias .
La media muestral es el valor promedio (o media ) de una muestra de números extraída de una población mayor , donde "población" se refiere no al número de personas, sino a la totalidad de los datos relevantes, ya sean recopilados o no. Por conveniencia, se puede utilizar una muestra de las ventas de 40 empresas de la lista Fortune 500 en lugar de analizar la población, es decir, las ventas de las 500 empresas. La media muestral se utiliza como estimador de la media poblacional, el valor promedio de toda la población, y es más probable que la estimación se aproxime a la media poblacional si la muestra es grande y representativa. La fiabilidad de la media muestral se estima mediante el error estándar , que a su vez se calcula utilizando la varianza de la muestra. Si la muestra es aleatoria, el error estándar disminuye con el tamaño de la muestra y la distribución de la media muestral se aproxima a la distribución normal a medida que aumenta el tamaño de la muestra.
El término "media muestral" también puede referirse a un vector de valores promedio cuando el estadístico analiza los valores de varias variables en la muestra, por ejemplo, las ventas, las ganancias y el número de empleados de una muestra de empresas Fortune 500. En este caso, no solo se dispone de la varianza muestral para cada variable, sino también de una matriz de covarianza muestral (o simplemente matriz de covarianza ) que muestra la relación entre cada par de variables. Esta sería una matriz de 3×3 cuando se consideran tres variables. La covarianza muestral es útil para evaluar la fiabilidad de las medias muestrales como estimadores y también como estimación de la matriz de covarianza poblacional.
Debido a su facilidad de cálculo y otras características deseables, la media muestral y la covarianza muestral se utilizan ampliamente en estadística para representar la ubicación y la dispersión de la distribución de valores en la muestra, y para estimar los valores de la población.
Definición de la media muestral
La media muestral es el promedio de los valores de una variable en una muestra, que es la suma de esos valores dividida por el número de valores. Utilizando notación matemática , si se toma una muestra de N observaciones de la variable X de la población, la media muestral es:
Según esta definición, si la muestra (1, 4, 1) se toma de la población (1,1,3,4,0,2,1,0), entonces la media de la muestra es, en comparación con la media poblacional deAunque una muestra sea aleatoria, rara vez es perfectamente representativa, y otras muestras tendrían medias diferentes incluso si todas provinieran de la misma población. La muestra (2, 1, 0), por ejemplo, tendría una media de 1.
Si el estadístico está interesado en K variables en lugar de una, y cada observación tiene un valor para cada una de esas K variables, la media muestral general consta de K medias muestrales para variables individuales.sea la i -ésima observación extraída independientemente ( i = 1, ..., N ) de la j -ésima variable aleatoria ( j = 1, ..., K ). Estas observaciones se pueden organizar en N vectores columna, cada uno con K entradas, donde el vector columna K × 1 que da las i -ésimas observaciones de todas las variables se denota( i =1,..., N ).
El vector de media muestrales un vector columna cuyo j -ésimo elementoes el valor promedio de las N observaciones de la j -ésima variable:
Así, el vector de media muestral contiene el promedio de las observaciones para cada variable y se escribe
Definición de covarianza muestral
La matriz de covarianza muestral es una matriz de K por K.con entradas
dóndees una estimación de la covarianza entre la j -ésima variable y la k -ésima variable de la población subyacente a los datos. En términos de los vectores de observación, la covarianza muestral es
Alternativamente, se pueden organizar los vectores de observación como las columnas de una matriz, de modo que
- ,
que es una matriz de K filas y N columnas. Aquí, la matriz de covarianza muestral se puede calcular como
- ,
dóndees un vector de unos de N por 1. Si las observaciones se organizan en filas en lugar de columnas, entoncesahora es un vector fila de 1× K yes una matriz N × K cuya columna j es el vector de N observaciones de la variable j , entonces al aplicar transposiciones en los lugares apropiados se obtiene
Al igual que las matrices de covarianza para vectores aleatorios , las matrices de covarianza de muestra son semidefinidas positivas . Para demostrarlo, observe que para cualquier matrizla matrizes semidefinida positiva. Además, una matriz de covarianza es definida positiva si y solo si el rango de laLos vectores son K.
Imparcialidad
La media muestral y la matriz de covarianza muestral son estimaciones insesgadas de la media y la matriz de covarianza del vector aleatorio., un vector fila cuyo j -ésimo elemento ( j = 1, ..., K ) es una de las variables aleatorias. [ 1 ] La matriz de covarianza muestral tieneen el denominador en lugar dedebido a una variante de la corrección de Bessel : En resumen, la covarianza muestral se basa en la diferencia entre cada observación y la media muestral, pero la media muestral está ligeramente correlacionada con cada observación ya que se define en términos de todas las observaciones. Si la media poblacionalSe conoce la estimación análoga insesgada.
utilizando la media poblacional, tieneen el denominador. Este es un ejemplo de por qué en probabilidad y estadística es esencial distinguir entre variables aleatorias (letras mayúsculas) y realizaciones de las variables aleatorias (letras minúsculas).
La estimación de máxima verosimilitud de la covarianza
En el caso de la distribución gaussiana, N también está en el denominador. La razón de 1/ N a 1/( N − 1) se aproxima a 1 para valores grandes de N , por lo que la estimación de máxima verosimilitud es aproximadamente igual a la estimación insesgada cuando la muestra es grande.
Distribución de la media muestral
For each random variable, the sample mean is a good estimator of the population mean, where a "good" estimator is defined as being efficient and unbiased. Of course the estimator will likely not be the true value of the population mean since different samples drawn from the same distribution will give different sample means and hence different estimates of the true mean. Thus the sample mean is a random variable, not a constant, and consequently has its own distribution.
Denoting with μ the population mean and with the population variance, for a random sample of nindependent observations drawn from the population, the expected value of the sample mean is
and the variance of the sample mean is
If the samples are not independent, but correlated, then special care has to be taken in order to avoid the problem of pseudoreplication.
If the population is normally distributed, then the sample mean is normally distributed as follows:
If the population is not normally distributed, the sample mean is nonetheless approximately normally distributed if n is large and σ2/n < +∞. This is a consequence of the central limit theorem.
Weighted samples
In a weighted sample, each vector (each set of single observations on each of the K random variables) is assigned a weight . Without loss of generality, assume that the weights are normalized:
(If they are not, divide the weights by their sum). Then the weighted mean vector is given by
and the elements of the weighted covariance matrix are [2]
If all weights are the same, , the weighted mean and covariance reduce to the (biased) sample mean and covariance mentioned above.
Criticism
The sample mean and sample covariance are not robust statistics, meaning that they are sensitive to outliers. As robustness is often a desired trait, particularly in real-world applications, robust alternatives may prove desirable, notably quantile-based statistics such as the sample median for location,[3] and interquartile range (IQR) for dispersion. Other alternatives include trimming and Winsorising, as in the trimmed mean and the Winsorized mean.
See also
Referencias
- ↑ Richard Arnold Johnson; Dean W. Wichern (2007). Análisis estadístico multivariante aplicado . Pearson Prentice Hall. ISBN 978-0-13-187715-3Consultado el 10 de agosto de 2012 .
- ↑ Mark Galassi, Jim Davies, James Theiler, Brian Gough, Gerard Jungman, Michael Booth y Fabrice Rossi. Biblioteca Científica GNU - Manual de referencia, Versión 2.6 , 2021. Sección Estadísticas: Muestras ponderadas
- ↑ The World Question Center 2006: La media muestral Archivado el 12/07/2019 en Wayback Machine , Bart Kosko
- Covarianza y correlación
- Métodos de estimación
- Estadísticas descriptivas
- Matrices (matemáticas)
- Estadísticas U