En estadística , un estimador es una regla para calcular una estimación de una cantidad dada basada en datos observados : así, se distinguen la regla (el estimador), la cantidad de interés (el estimador ) y su resultado (la estimación). [ 1 ] Por ejemplo, la media muestral es un estimador comúnmente utilizado de la media poblacional .
Existen estimadores puntuales y de intervalo . Los estimadores puntuales producen resultados de un solo valor. Esto contrasta con los estimadores de intervalo , cuyo resultado es un rango de valores plausibles. "Un solo valor" no significa necesariamente "un solo número", sino que incluye estimadores vectoriales o funcionales.
La teoría de la estimación se centra en las propiedades de los estimadores; es decir, en definir propiedades que permitan comparar diferentes estimadores (diferentes reglas para generar estimaciones) para la misma magnitud, a partir de los mismos datos. Dichas propiedades pueden utilizarse para determinar las mejores reglas en determinadas circunstancias. Sin embargo, en estadística robusta , la teoría estadística va más allá y considera el equilibrio entre tener buenas propiedades, si se cumplen supuestos estrictos, y tener propiedades peores que se cumplen en condiciones más amplias.
Discusión
Un "estimador" o " estimación puntual " es una estadística (es decir, una función de los datos) que se utiliza para inferir el valor de un parámetro desconocido en un modelo estadístico . Una forma común de expresarlo es "el estimador es el método seleccionado para obtener una estimación de un parámetro desconocido". El parámetro que se estima a veces se denomina estimando . Puede ser de dimensión finita (en modelos paramétricos y semiparamétricos ) o de dimensión infinita ( modelos semiparamétricos y no paramétricos ). [ 2 ] Si el parámetro se denotaEntonces, el estimador se escribe tradicionalmente agregando un acento circunflejo sobre el símbolo:Al ser una función de los datos, el estimador es en sí mismo una variable aleatoria ; una realización particular de esta variable aleatoria se denomina "estimación". A veces, los términos "estimador" y "estimación" se usan indistintamente.
La definición prácticamente no impone restricciones sobre qué funciones de los datos pueden denominarse "estimadores". El atractivo de los diferentes estimadores se puede evaluar considerando sus propiedades, como la insesgadez , el error cuadrático medio , la consistencia , la distribución asintótica , etc. La construcción y comparación de estimadores son objeto de la teoría de la estimación . En el contexto de la teoría de la decisión , un estimador es un tipo de regla de decisión , y su desempeño puede evaluarse mediante el uso de funciones de pérdida .
Cuando se utiliza el término «estimador» sin calificativo, generalmente se refiere a la estimación puntual. En este caso, la estimación es un único punto en el espacio de parámetros . También existe otro tipo de estimador: los estimadores de intervalo , donde las estimaciones son subconjuntos del espacio de parámetros.
El problema de la estimación de densidad surge en dos aplicaciones. En primer lugar, en la estimación de las funciones de densidad de probabilidad de variables aleatorias y, en segundo lugar, en la estimación de la función de densidad espectral de una serie temporal . En estos problemas, las estimaciones son funciones que pueden considerarse estimaciones puntuales en un espacio de dimensión infinita, y existen problemas de estimación por intervalos correspondientes.
Definición
Supongamos un parámetro fijonecesita ser estimado. Entonces, un "estimador" es una función que mapea el espacio muestral a un conjunto de estimaciones muestrales . Un estimador dese suele denotar con el símbolo. A menudo resulta conveniente expresar la teoría utilizando el álgebra de variables aleatorias : por lo tanto, sise utiliza para denotar una variable aleatoria correspondiente a los datos observados, el estimador (que a su vez se trata como una variable aleatoria) se simboliza como una función de esa variable aleatoria,La estimación para un valor de datos observado en particular(es decir, para) es entonces, que es un valor fijo. A menudo se utiliza una notación abreviada en la quese interpreta directamente como una variable aleatoria , pero esto puede causar confusión.
Propiedades cuantificadas
Las siguientes definiciones y atributos son relevantes. [ 3 ]
Error
Para una muestra determinada, el " error " del estimadorse define como dóndees el parámetro que se está estimando. El error, e , depende no solo del estimador (la fórmula o procedimiento de estimación), sino también de la muestra.
Error cuadrático medio
El error cuadrático medio dese define como el valor esperado (promedio ponderado por probabilidad, sobre todas las muestras) de los errores al cuadrado; es decir, Se utiliza para indicar cuán lejos, en promedio, se encuentra el conjunto de estimaciones del parámetro único que se está estimando. Consideremos la siguiente analogía. Supongamos que el parámetro es el centro de una diana , el estimador es el proceso de disparar flechas a la diana, y las flechas individuales son estimaciones (muestras). Entonces, un MSE alto significa que la distancia promedio de las flechas al centro es alta, y un MSE bajo significa que la distancia promedio al centro es baja. Las flechas pueden estar agrupadas o no. Por ejemplo, incluso si todas las flechas impactan en el mismo punto, pero fallan ampliamente la diana, el MSE sigue siendo relativamente alto. Sin embargo, si el MSE es relativamente bajo, es probable que las flechas estén más agrupadas (que dispersas) alrededor de la diana.
Desviación de muestreo
Para una muestra determinada, la desviación de muestreo del estimadorse define como dóndees el valor esperado del estimador. La desviación de muestreo,, depende no solo del estimador, sino también de la muestra.
Diferencia
La varianza dees el valor esperado de las desviaciones de muestreo al cuadrado; es decir,Se utiliza para indicar cuán lejos, en promedio, se encuentra el conjunto de estimaciones del valor esperado de las mismas. (Nótese la diferencia entre el error cuadrático medio y la varianza). Si el parámetro es el centro de una diana y las flechas son estimaciones, entonces una varianza relativamente alta significa que las flechas están dispersas, y una varianza relativamente baja significa que las flechas están agrupadas. Incluso si la varianza es baja, el grupo de flechas aún puede estar muy lejos de la diana, e incluso si la varianza es alta, el conjunto disperso de flechas aún puede ser insesgado. Finalmente, incluso si todas las flechas fallan ampliamente la diana, si no obstante todas dan en el mismo punto, la varianza es cero.
Inclinación
El sesgo dese define comoEs la distancia entre el promedio del conjunto de estimaciones y el parámetro único que se está estimando. El sesgo dees una función del verdadero valor deasí que decir que el sesgo deessignifica que para cadael sesgo dees.
Hay dos tipos de estimadores: estimadores sesgados y estimadores insesgados. Si un estimador es sesgado o no se puede identificar por la relación entrey 0:
- Si,es parcial.
- Si,es imparcial.
El sesgo es también el valor esperado del error, ya queSi el parámetro es el centro de una diana y las flechas son estimaciones, entonces un valor absoluto relativamente alto para el sesgo significa que la posición promedio de las flechas está fuera de la diana, y un sesgo absoluto relativamente bajo significa que la posición promedio de las flechas está en la diana. Pueden estar dispersas o agrupadas. La relación entre el sesgo y la varianza es análoga a la relación entre la exactitud y la precisión .
El estimadores un estimador insesgado desi y solo siEl sesgo es una propiedad del estimador, no de la estimación. A menudo se habla de una "estimación sesgada" o una "estimación insesgada", pero en realidad se hace referencia a una "estimación de un estimador sesgado" o una "estimación de un estimador insesgado". Además, se suele confundir el "error" de una sola estimación con el "sesgo" de un estimador. Que el error de una estimación sea grande no significa que el estimador esté sesgado. De hecho, incluso si todas las estimaciones tienen valores absolutos astronómicos para sus errores, si el valor esperado del error es cero, el estimador es insesgado. Asimismo, que un estimador esté sesgado no impide que el error de una estimación sea cero en un caso particular. La situación ideal es tener un estimador insesgado con baja varianza y también intentar limitar el número de muestras donde el error es extremo (es decir, tener pocos valores atípicos ). Sin embargo, la ausencia de sesgo no es esencial. A menudo, si se permite un pequeño sesgo, se puede encontrar un estimador con un error cuadrático medio menor y/o menos estimaciones de muestras atípicas.
Una alternativa a la versión "insesgada" anterior es la "mediana insesgada", donde la mediana de la distribución de las estimaciones coincide con el valor verdadero; por lo tanto, a largo plazo, la mitad de las estimaciones serán demasiado bajas y la otra mitad demasiado altas. Si bien esto se aplica inmediatamente solo a estimadores escalares, puede extenderse a cualquier medida de tendencia central de una distribución: véase estimadores mediana insesgados .
En un problema práctico,siempre puede tener una relación funcional conPor ejemplo, si una teoría genética afirma que hay un tipo de hoja (verde almidonada) que aparece con probabilidad, con. Entonces, parahojas, la variable aleatoria, o el número de hojas verdes almidonadas, se puede modelar con undistribución. El número se puede utilizar para expresar el siguiente estimador para:Se puede demostrar quees un estimador insesgado para:
Imparcialidad

Una propiedad deseable para los estimadores es la insesgadez, es decir, que un estimador no tenga una tendencia sistemática a producir estimaciones mayores o menores que el parámetro verdadero. Además, se prefieren los estimadores insesgados con menor varianza a aquellos con mayor varianza, ya que estarán más cerca del valor "verdadero" del parámetro. El estimador insesgado con la menor varianza se conoce como estimador insesgado de mínima varianza (MVUE).
Para averiguar si un estimadores imparcial, es fácil seguir la ecuación. Con estimador T con y parámetro de interésResolviendo la ecuación anterior, se muestra comoEl estimador es insesgado. Al observar la figura de la derecha, a pesar desiendo el único estimador insesgado, si las distribuciones se superponían y ambas estaban centradas enluego distribuciónEn realidad, sería el estimador imparcial preferido.
Expectativa Al observar cantidades en interés de la expectativa para la distribución del modelo hay un estimador insesgado que debe satisfacer las dos ecuaciones siguientes.
Varianza De manera similar, al observar cantidades en interés de la varianza como distribución del modelo, también existe un estimador insesgado que debe satisfacer las dos ecuaciones siguientes.
Nótese que estamos dividiendo por n − 1 porque si dividiéramos con n obtendríamos un estimador con un sesgo negativo que produciría estimaciones demasiado pequeñas paraTambién cabe mencionar que, aunquees imparcial paraLo contrario no es cierto. [ 4 ]
Relaciones entre las cantidades
- El error cuadrático medio, la varianza y el sesgo están relacionados:Es decir, el error cuadrático medio = varianza + cuadrado del sesgo. En particular, para un estimador insesgado, la varianza es igual al error cuadrático medio.
- La desviación estándar de un estimadorde(la raíz cuadrada de la varianza), o una estimación de la desviación estándar de un estimadorde, se denomina error estándar de.
- La compensación entre sesgo y varianza se utilizará en la complejidad del modelo, el sobreajuste y el subajuste. Se emplea principalmente en el campo del aprendizaje supervisado y el modelado predictivo para diagnosticar el rendimiento de los algoritmos.
Ejemplo
Consideremos una variable aleatoria que sigue una distribución de probabilidad normal.y un estimador sesgado de la mediade esa distribución dóndesigue una distribución degenerada , es decir, de tal manera que donde todos los términos son cero exceptoutilizando la fórmula de Bienaymé y Verificamos la relación entre el error cuadrático medio, la varianza y el sesgo. A continuación se ilustran las propiedades cuantificadas de la estimación de la media de la distribución de probabilidad, tomando como referencia,y.
Propiedades de comportamiento
Consistencia
Un estimador consistente es aquel cuya secuencia de estimaciones converge en probabilidad a la cantidad que se está estimando a medida que el índice (generalmente el tamaño de la muestra ) crece indefinidamente. En otras palabras, aumentar el tamaño de la muestra incrementa la probabilidad de que el estimador se aproxime al parámetro poblacional.
Matemáticamente, un estimador es un estimador consistente para el parámetro, si y solo si para la secuencia de estimacionesy para todos, por muy pequeños que sean, tenemos La consistencia definida anteriormente puede denominarse consistencia débil. La sucesión es fuertemente consistente si converge casi con seguridad al valor verdadero.
Un estimador que converge a un múltiplo de un parámetro puede convertirse en un estimador consistente multiplicándolo por un factor de escala , es decir, el valor verdadero dividido por el valor asintótico del estimador. Esto ocurre con frecuencia en la estimación de parámetros de escala mediante medidas de dispersión estadística .
Consistencia de Fisher
Un estimador puede considerarse consistente en el sentido de Fisher siempre que sea el mismo funcional de la función de distribución empírica que la función de distribución verdadera. Siguiendo la fórmula: Dóndeyson la función de distribución empírica y la función de distribución teórica, respectivamente. Un ejemplo sencillo para comprobar si un estimador es consistente con Fisher es verificar la consistencia de la media y la varianza. Por ejemplo, para comprobar la consistencia de la mediay para comprobar la varianza confirme que. [ 5 ]
normalidad asintótica
Un estimador asintóticamente normal es un estimador consistente cuya distribución alrededor del parámetro verdaderose aproxima a una distribución normal con desviación estándar que disminuye en proporción acomo tamaño de la muestracrece. Usandopara denotar convergencia en distribución , un estimadores asintóticamente normal si para algunos.
En esta formulaciónpuede denominarse la varianza asintótica del estimador. Sin embargo, algunos autores también la denominanla varianza asintótica . [ 6 ] Nótese que la convergencia no necesariamente habrá ocurrido para ningún valor finito., por lo tanto, este valor es solo una aproximación a la verdadera varianza del estimador, mientras que en el límite la varianza asintóticaes simplemente cero. En particular, la distribución del estimadorconverge débilmente a una función delta de Dirac centrada en.
Bajo condiciones leves sobre la distribución de los datos, el teorema del límite central implica la normalidad asintótica de la media muestral.como estimador de la media verdadera. En términos más generales, los estimadores de máxima verosimilitud son asintóticamente normales bajo condiciones de regularidad bastante débiles (véase la sección de asintótica del artículo sobre máxima verosimilitud). Sin embargo, no todos los estimadores son asintóticamente normales; los ejemplos más sencillos se dan cuando el valor verdadero de un parámetro se encuentra en el límite de la región de parámetros permitida.
Eficiencia
La eficiencia de un estimador se utiliza para estimar la cantidad de interés de manera que se minimice el error. En realidad, no existe un estimador óptimo explícito; solo puede existir un estimador mejor. Si la eficiencia de un estimador es mejor o no se basa en la elección de una función de pérdida particular , y se refleja en dos propiedades naturalmente deseables de los estimadores: ser insesgadoy tener un error cuadrático medio (ECM) mínimo.. En general, estas dos condiciones no pueden satisfacerse simultáneamente: un estimador sesgado puede tener un error cuadrático medio menor que cualquier estimador insesgado (véase sesgo del estimador ).
Esta ecuación relaciona el error cuadrático medio con el sesgo del estimador: [ 4 ]El primer término representa el error cuadrático medio; el segundo término representa el cuadrado del sesgo del estimador; y el tercer término representa la varianza del estimador. La calidad del estimador se puede identificar a partir de la comparación entre la varianza, el cuadrado del sesgo del estimador o el ECM. La varianza del buen estimador (buena eficiencia) sería menor que la varianza del mal estimador (mala eficiencia). El cuadrado del sesgo de un estimador con un buen estimador sería menor que el sesgo del estimador con un mal estimador. El ECM de un buen estimador sería menor que el ECM del mal estimador. Supongamos que hay dos estimadores,es el buen estimador yes el mal estimador. La relación anterior se puede expresar mediante las siguientes fórmulas:Además de utilizar fórmulas para identificar la eficiencia del estimador, también se puede identificar mediante un gráfico. Si un estimador es eficiente, en el gráfico de frecuencia frente a valor, habrá una curva con alta frecuencia en el centro y baja frecuencia en los extremos. Por ejemplo:

Si un estimador no es eficiente, en el gráfico de frecuencia frente a valor, habrá una curva relativamente más suave.

En pocas palabras, el buen estimador tiene una curva estrecha, mientras que el mal estimador tiene una curva ancha. Al representar gráficamente estas dos curvas con un eje Y común , la diferencia se hace más evidente.

Entre los estimadores insesgados, suele existir uno con la menor varianza, denominado estimador insesgado de varianza mínima ( MVUE ). En algunos casos, existe un estimador eficiente insesgado que, además de tener la menor varianza entre los estimadores insesgados, satisface la cota de Cramér-Rao , que es una cota inferior absoluta para la varianza de las estadísticas de una variable.
En relación con dichos "mejores estimadores insesgados", véase también la cota de Cramér-Rao , el teorema de Gauss-Markov , el teorema de Lehmann-Scheffé y el teorema de Rao-Blackwell .
Robustez
Véase también
- Estimador lineal insesgado óptimo (BLUE)
- Medida empírica
- Teoría de la estimación
- Estimador invariante
- filtro de Kalman
- Cadena de Markov Monte Carlo (MCMC)
- Máxima a posteriori (MAP)
- Método de los momentos , método generalizado de los momentos
- Error cuadrático medio mínimo (MMSE)
- Filtro de partículas
- Criterio de proximidad de Pitman
- Estimación puntual
- Sensibilidad y especificidad
- Estimador de merma
- Procesamiento de señales
- observador estatal
- Estimador T
- Filtro de Wiener
- Estadística bien comportada
Referencias
- ↑ Mosteller, F.; Tukey, JW (1987) [1968]. «Análisis de datos, incluyendo estadística» . Obras completas de John W. Tukey: Filosofía y principios del análisis de datos 1965–1986 . Vol. 4. CRC Press. pp. 601–720 [p. 633]. ISBN 0-534-05101-4– vía Google Libros .
- ^ Kosorok (2008), sección 3.1, págs. 35–39.
- ↑ Jaynes (2007), pág. 172.
- ^ Dekking , Frederik Michel; Kraaikamp, Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). Una introducción moderna a la probabilidad y la estadística . Textos Springer en Estadística. ISBN 978-1-85233-896-1.
- ↑ Lauritzen, Steffen. "Propiedades de los estimadores" (PDF) . Universidad de Oxford . Consultado el 9 de diciembre de 2023 .
- ↑ Casella y Berger (2002), pág. 471
Lecturas adicionales
- Bol'shev, Login Nikolaevich (2001) [1994], "Estimador estadístico" , Enciclopedia de Matemáticas , EMS Press.
- Casella, George; Berger, Roger L. (2002). Inferencia estadística (2ª ed.). Duxbury.
- Jaynes, ET (2007). Teoría de la probabilidad: La lógica de la ciencia (5.ª ed.). Cambridge University Press . ISBN 978-0-521-59271-0..
- Kosorok, Michael (2008). Introducción a los procesos empíricos y la inferencia semiparamétrica . Springer Series in Statistics. Springer . doi : 10.1007/978-0-387-74978-5 . ISBN 978-0-387-74978-5.
- Lehmann, EL ; Casella, G. (1998). Teoría de la estimación puntual (2.ª ed.). Springer . ISBN 0-387-98502-6.
- Shao, Jun (1998), Estadística matemática , Springer , ISBN 0-387-98674-X
Enlaces externos
- Fundamentos de la teoría de la estimación
- Estimador