La media muestral ( promedio muestral ) o media empírica ( promedio empírico ), y la covarianza muestral o covarianza empírica son estadísticas calculadas a partir de una muestra de datos sobre una o más variables aleatorias .
La media muestral es el valor promedio (o media ) de una muestra de números extraída de una población mayor , donde "población" se refiere no al número de personas, sino a la totalidad de los datos relevantes, ya sean recopilados o no. Por conveniencia, se puede utilizar una muestra de las ventas de 40 empresas de la lista Fortune 500 en lugar de analizar la población, es decir, las ventas de las 500 empresas. La media muestral se utiliza como estimador de la media poblacional, el valor promedio de toda la población, y es más probable que la estimación se aproxime a la media poblacional si la muestra es grande y representativa. La fiabilidad de la media muestral se estima mediante el error estándar , que a su vez se calcula utilizando la varianza de la muestra. Si la muestra es aleatoria, el error estándar disminuye con el tamaño de la muestra y la distribución de la media muestral se aproxima a la distribución normal a medida que aumenta el tamaño de la muestra.
El término "media muestral" también puede referirse a un vector de valores promedio cuando el estadístico analiza los valores de varias variables en la muestra, por ejemplo, las ventas, las ganancias y el número de empleados de una muestra de empresas Fortune 500. En este caso, no solo se dispone de la varianza muestral para cada variable, sino también de una matriz de covarianza muestral (o simplemente matriz de covarianza ) que muestra la relación entre cada par de variables. Esta sería una matriz de 3×3 cuando se consideran tres variables. La covarianza muestral es útil para evaluar la fiabilidad de las medias muestrales como estimadores y también como estimación de la matriz de covarianza poblacional.
Debido a su facilidad de cálculo y otras características deseables, la media muestral y la covarianza muestral se utilizan ampliamente en estadística para representar la ubicación y la dispersión de la distribución de valores en la muestra, y para estimar los valores de la población.
Definición de la media muestral
La media muestral es el promedio de los valores de una variable en una muestra, que es la suma de esos valores dividida por el número de valores. Utilizando notación matemática , si se toma una muestra de N observaciones de la variable X de la población, la media muestral es:
Según esta definición, si la muestra (1, 4, 1) se toma de la población (1,1,3,4,0,2,1,0), entonces la media de la muestra es, en comparación con la media poblacional deAunque una muestra sea aleatoria, rara vez es perfectamente representativa, y otras muestras tendrían medias diferentes incluso si todas provinieran de la misma población. La muestra (2, 1, 0), por ejemplo, tendría una media de 1.
Si el estadístico está interesado en K variables en lugar de una, y cada observación tiene un valor para cada una de esas K variables, la media muestral general consta de K medias muestrales para variables individuales.sea la i -ésima observación extraída independientemente ( i = 1, ..., N ) de la j -ésima variable aleatoria ( j = 1, ..., K ). Estas observaciones se pueden organizar en N vectores columna, cada uno con K entradas, donde el vector columna K × 1 que da las i -ésimas observaciones de todas las variables se denota( i =1,..., N ).
El vector de media muestrales un vector columna cuyo j -ésimo elementoes el valor promedio de las N observaciones de la j -ésima variable:
Así, el vector de media muestral contiene el promedio de las observaciones para cada variable y se escribe
Definición de covarianza muestral
La matriz de covarianza muestral es una matriz de K por K.con entradas
dóndees una estimación de la covarianza entre la j -ésima variable y la k -ésima variable de la población subyacente a los datos. En términos de los vectores de observación, la covarianza muestral es
Alternativamente, se pueden organizar los vectores de observación como las columnas de una matriz, de modo que
- ,
que es una matriz de K filas y N columnas. Aquí, la matriz de covarianza muestral se puede calcular como
- ,
dóndees un vector de unos de N por 1. Si las observaciones se organizan en filas en lugar de columnas, entoncesahora es un vector fila de 1× K yes una matriz N × K cuya columna j es el vector de N observaciones de la variable j , entonces al aplicar transposiciones en los lugares apropiados se obtiene
Al igual que las matrices de covarianza para vectores aleatorios , las matrices de covarianza de muestra son semidefinidas positivas . Para demostrarlo, observe que para cualquier matrizla matrizes semidefinida positiva. Además, una matriz de covarianza es definida positiva si y solo si el rango de laLos vectores son K.
Imparcialidad
La media muestral y la matriz de covarianza muestral son estimaciones insesgadas de la media y la matriz de covarianza del vector aleatorio., un vector fila cuyo j -ésimo elemento ( j = 1, ..., K ) es una de las variables aleatorias. [ 1 ] La matriz de covarianza muestral tieneen el denominador en lugar dedebido a una variante de la corrección de Bessel : En resumen, la covarianza muestral se basa en la diferencia entre cada observación y la media muestral, pero la media muestral está ligeramente correlacionada con cada observación ya que se define en términos de todas las observaciones. Si la media poblacionalSe conoce la estimación análoga insesgada.
utilizando la media poblacional, tieneen el denominador. Este es un ejemplo de por qué en probabilidad y estadística es esencial distinguir entre variables aleatorias (letras mayúsculas) y realizaciones de las variables aleatorias (letras minúsculas).
La estimación de máxima verosimilitud de la covarianza
En el caso de la distribución gaussiana, N también está en el denominador. La razón de 1/ N a 1/( N − 1) se aproxima a 1 para valores grandes de N , por lo que la estimación de máxima verosimilitud es aproximadamente igual a la estimación insesgada cuando la muestra es grande.
Distribución de la media muestral
Para cada variable aleatoria, la media muestral es un buen estimador de la media poblacional, donde un estimador "bueno" se define como eficiente e insesgado. Por supuesto, es probable que el estimador no sea el valor real de la media poblacional , ya que diferentes muestras extraídas de la misma distribución darán diferentes medias muestrales y, por lo tanto, diferentes estimaciones de la media real. Así pues, la media muestral es una variable aleatoria , no una constante, y, en consecuencia, tiene su propia distribución.
Denotando con μ la media poblacional y conLa varianza poblacional, para una muestra aleatoria de n observaciones independientes extraídas de la población, el valor esperado de la media muestral es
y la varianza de la media muestral es
Si las muestras no son independientes, sino que están correlacionadas , entonces se debe tener especial cuidado para evitar el problema de la pseudorreplicación .
Si la población tiene una distribución normal , entonces la media muestral tiene una distribución normal de la siguiente manera:
Si la población no tiene una distribución normal, la media muestral, no obstante, tiene una distribución aproximadamente normal si n es grande y σ 2 / n < +∞. Esto es una consecuencia del teorema del límite central .
Muestras ponderadas
En una muestra ponderada, cada vector(a cada conjunto de observaciones individuales en cada una de las K variables aleatorias) se le asigna un pesoSin pérdida de generalidad , supongamos que los pesos están normalizados :
(Si no lo son, divida los pesos por su suma). Entonces el vector de media ponderadaes dado por
y los elementosde la matriz de covarianza ponderadason [ 2 ]
Si todos los pesos son iguales,, la media ponderada y la covarianza se reducen a la media muestral (sesgada) y la covarianza mencionadas anteriormente.
Crítica
La media muestral y la covarianza muestral no son estadísticas robustas , lo que significa que son sensibles a los valores atípicos . Dado que la robustez suele ser una característica deseada, especialmente en aplicaciones del mundo real, pueden resultar deseables alternativas robustas, en particular las estadísticas basadas en cuantiles , como la mediana muestral para la ubicación [ 3 ] y el rango intercuartil (RIC) para la dispersión. Otras alternativas incluyen el recorte y la winsorización , como en la media recortada y la media winsorizada .
Véase también
Referencias
- ↑ Richard Arnold Johnson; Dean W. Wichern (2007). Análisis estadístico multivariante aplicado . Pearson Prentice Hall. ISBN 978-0-13-187715-3Consultado el 10 de agosto de 2012 .
- ↑ Mark Galassi, Jim Davies, James Theiler, Brian Gough, Gerard Jungman, Michael Booth y Fabrice Rossi. Biblioteca Científica GNU - Manual de referencia, Versión 2.6 , 2021. Sección Estadísticas: Muestras ponderadas
- ↑ The World Question Center 2006: La media muestral Archivado el 12/07/2019 en Wayback Machine , Bart Kosko
- Covarianza y correlación
- Métodos de estimación
- Estadísticas descriptivas
- Matrices (matemáticas)
- Estadísticas U