Articulo de referencia

Estimador

En estadística , un estimador es una regla para calcular una estimación de una cantidad dada basada en datos observados : así, se distinguen la regla (el estimador), la cantidad...

En estadística , un estimador es una regla para calcular una estimación de una cantidad dada basada en datos observados : así, se distinguen la regla (el estimador), la cantidad de interés (el estimador ) y su resultado (la estimación). [ 1 ] Por ejemplo, la media muestral es un estimador comúnmente utilizado de la media poblacional .

Existen estimadores puntuales y de intervalo . Los estimadores puntuales producen resultados de un solo valor. Esto contrasta con los estimadores de intervalo , cuyo resultado es un rango de valores plausibles. "Un solo valor" no significa necesariamente "un solo número", sino que incluye estimadores vectoriales o funcionales.

La teoría de la estimación se centra en las propiedades de los estimadores; es decir, en definir propiedades que permitan comparar diferentes estimadores (diferentes reglas para generar estimaciones) para la misma magnitud, a partir de los mismos datos. Dichas propiedades pueden utilizarse para determinar las mejores reglas en determinadas circunstancias. Sin embargo, en estadística robusta , la teoría estadística va más allá y considera el equilibrio entre tener buenas propiedades, si se cumplen supuestos estrictos, y tener propiedades peores que se cumplen en condiciones más amplias.

Discusión

Un "estimador" o " estimación puntual " es una estadística (es decir, una función de los datos) que se utiliza para inferir el valor de un parámetro desconocido en un modelo estadístico . Una forma común de expresarlo es "el estimador es el método seleccionado para obtener una estimación de un parámetro desconocido". El parámetro que se estima a veces se denomina estimando . Puede ser de dimensión finita (en modelos paramétricos y semiparamétricos ) o de dimensión infinita ( modelos semiparamétricos y no paramétricos ). [ 2 ] Si el parámetro se denotaθ{\displaystyle \theta }Entonces, el estimador se escribe tradicionalmente agregando un acento circunflejo sobre el símbolo:θ^{\displaystyle {\widehat {\theta }}}Al ser una función de los datos, el estimador es en sí mismo una variable aleatoria ; una realización particular de esta variable aleatoria se denomina "estimación". A veces, los términos "estimador" y "estimación" se usan indistintamente.

La definición prácticamente no impone restricciones sobre qué funciones de los datos pueden denominarse "estimadores". El atractivo de los diferentes estimadores se puede evaluar considerando sus propiedades, como la insesgadez , el error cuadrático medio , la consistencia , la distribución asintótica , etc. La construcción y comparación de estimadores son objeto de la teoría de la estimación . En el contexto de la teoría de la decisión , un estimador es un tipo de regla de decisión , y su desempeño puede evaluarse mediante el uso de funciones de pérdida .

Cuando se utiliza el término «estimador» sin calificativo, generalmente se refiere a la estimación puntual. En este caso, la estimación es un único punto en el espacio de parámetros . También existe otro tipo de estimador: los estimadores de intervalo , donde las estimaciones son subconjuntos del espacio de parámetros.

El problema de la estimación de densidad surge en dos aplicaciones. En primer lugar, en la estimación de las funciones de densidad de probabilidad de variables aleatorias y, en segundo lugar, en la estimación de la función de densidad espectral de una serie temporal . En estos problemas, las estimaciones son funciones que pueden considerarse estimaciones puntuales en un espacio de dimensión infinita, y existen problemas de estimación por intervalos correspondientes.

Definición

Supongamos un parámetro fijoθ{\displaystyle \theta }necesita ser estimado. Entonces, un "estimador" es una función que mapea el espacio muestral a un conjunto de estimaciones muestrales . Un estimador deθ{\displaystyle \theta }se suele denotar con el símboloθ^{\displaystyle {\widehat {\theta }}}. A menudo resulta conveniente expresar la teoría utilizando el álgebra de variables aleatorias : por lo tanto, siincógnita{\displaystyle X}se utiliza para denotar una variable aleatoria correspondiente a los datos observados, el estimador (que a su vez se trata como una variable aleatoria) se simboliza como una función de esa variable aleatoria,θ^(incógnita){\displaystyle {\widehat {\theta }}(X)}La estimación para un valor de datos observado en particularincógnita{\displaystyle x}(es decir, paraincógnita=incógnita{\displaystyle X=x}) es entoncesθ^(incógnita){\displaystyle {\widehat {\theta }}(x)}, que es un valor fijo. A menudo se utiliza una notación abreviada en la queθ^{\displaystyle {\widehat {\theta }}}se interpreta directamente como una variable aleatoria , pero esto puede causar confusión.

Propiedades cuantificadas

Las siguientes definiciones y atributos son relevantes. [ 3 ]

Error

Para una muestra determinadaincógnita{\displaystyle x}, el " error " del estimadorθ^{\displaystyle {\widehat {\theta }}}se define como mi(incógnita)=θ^(incógnita)θ,{\displaystyle e(x)={\widehat {\theta }}(x)-\theta ,} dóndeθ{\displaystyle \theta }es el parámetro que se está estimando. El error, e , depende no solo del estimador (la fórmula o procedimiento de estimación), sino también de la muestra.

Error cuadrático medio

El error cuadrático medio deθ^{\displaystyle {\widehat {\theta }}}se define como el valor esperado (promedio ponderado por probabilidad, sobre todas las muestras) de los errores al cuadrado; es decir, MSE(θ^)=mi[(θ^(incógnita)θ)2].{\displaystyle \operatorname {MSE} ({\widehat {\theta }})=\operatorname {E} [({\widehat {\theta }}(X)-\theta )^{2}].} Se utiliza para indicar cuán lejos, en promedio, se encuentra el conjunto de estimaciones del parámetro único que se está estimando. Consideremos la siguiente analogía. Supongamos que el parámetro es el centro de una diana , el estimador es el proceso de disparar flechas a la diana, y las flechas individuales son estimaciones (muestras). Entonces, un MSE alto significa que la distancia promedio de las flechas al centro es alta, y un MSE bajo significa que la distancia promedio al centro es baja. Las flechas pueden estar agrupadas o no. Por ejemplo, incluso si todas las flechas impactan en el mismo punto, pero fallan ampliamente la diana, el MSE sigue siendo relativamente alto. Sin embargo, si el MSE es relativamente bajo, es probable que las flechas estén más agrupadas (que dispersas) alrededor de la diana.

Desviación de muestreo

Para una muestra determinadaincógnita{\displaystyle x}, la desviación de muestreo del estimadorθ^{\displaystyle {\widehat {\theta }}}se define como d(incógnita)=θ^(incógnita)mi[θ^(incógnita)]=θ^(incógnita)mi[θ^],{\displaystyle d(x)={\widehat {\theta }}(x)-\operatorname {E} [{\widehat {\theta }}(X)]={\widehat {\theta }}(x)-\operatorname {E} [{\widehat {\theta }}],} dóndemi[θ^(incógnita)]{\displaystyle \operatorname {E} [{\widehat {\theta }}(X)]}es el valor esperado del estimador. La desviación de muestreo,d{\displaystyle d}, depende no solo del estimador, sino también de la muestra.

Diferencia

La varianza deθ^{\displaystyle {\widehat {\theta }}}es el valor esperado de las desviaciones de muestreo al cuadrado; es decir,Var(θ^)=mi[(θ^mi[θ^])2]{\displaystyle \operatorname {Var} ({\widehat {\theta }})=\operatorname {E} [({\widehat {\theta }}-\operatorname {E} [{\widehat {\theta }}])^{2}]}Se utiliza para indicar cuán lejos, en promedio, se encuentra el conjunto de estimaciones del valor esperado de las mismas. (Nótese la diferencia entre el error cuadrático medio y la varianza). Si el parámetro es el centro de una diana y las flechas son estimaciones, entonces una varianza relativamente alta significa que las flechas están dispersas, y una varianza relativamente baja significa que las flechas están agrupadas. Incluso si la varianza es baja, el grupo de flechas aún puede estar muy lejos de la diana, e incluso si la varianza es alta, el conjunto disperso de flechas aún puede ser insesgado. Finalmente, incluso si todas las flechas fallan ampliamente la diana, si no obstante todas dan en el mismo punto, la varianza es cero.

Inclinación

El sesgo deθ^{\displaystyle {\widehat {\theta }}}se define comoB(θ^)=mi[θ^]θ{\displaystyle B({\widehat {\theta }})=\operatorname {E} [{\widehat {\theta }}]-\theta }Es la distancia entre el promedio del conjunto de estimaciones y el parámetro único que se está estimando. El sesgo deθ^{\displaystyle {\widehat {\theta }}}es una función del verdadero valor deθ{\displaystyle \theta }así que decir que el sesgo deθ^{\displaystyle {\widehat {\theta }}}esb{\displaystyle b}significa que para cadaθ{\displaystyle \theta }el sesgo deθ^{\displaystyle {\widehat {\theta }}}esb{\displaystyle b}.

Hay dos tipos de estimadores: estimadores sesgados y estimadores insesgados. Si un estimador es sesgado o no se puede identificar por la relación entremi[θ^]θ{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta }y 0:

  • Simi[θ^]θ0{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta \neq 0},θ^{\displaystyle {\widehat {\theta }}}es parcial.
  • Simi[θ^]θ=0{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta =0},θ^{\displaystyle {\widehat {\theta }}}es imparcial.

El sesgo es también el valor esperado del error, ya quemi[θ^]θ=mi[θ^θ]{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta =\operatorname {E} [{\widehat {\theta }}-\theta ]}Si el parámetro es el centro de una diana y las flechas son estimaciones, entonces un valor absoluto relativamente alto para el sesgo significa que la posición promedio de las flechas está fuera de la diana, y un sesgo absoluto relativamente bajo significa que la posición promedio de las flechas está en la diana. Pueden estar dispersas o agrupadas. La relación entre el sesgo y la varianza es análoga a la relación entre la exactitud y la precisión .

El estimadorθ^{\displaystyle {\widehat {\theta }}}es un estimador insesgado deθ{\displaystyle \theta }si y solo siB(θ^)=0{\displaystyle B({\widehat {\theta }})=0}El sesgo es una propiedad del estimador, no de la estimación. A menudo se habla de una "estimación sesgada" o una "estimación insesgada", pero en realidad se hace referencia a una "estimación de un estimador sesgado" o una "estimación de un estimador insesgado". Además, se suele confundir el "error" de una sola estimación con el "sesgo" de un estimador. Que el error de una estimación sea grande no significa que el estimador esté sesgado. De hecho, incluso si todas las estimaciones tienen valores absolutos astronómicos para sus errores, si el valor esperado del error es cero, el estimador es insesgado. Asimismo, que un estimador esté sesgado no impide que el error de una estimación sea cero en un caso particular. La situación ideal es tener un estimador insesgado con baja varianza y también intentar limitar el número de muestras donde el error es extremo (es decir, tener pocos valores atípicos ). Sin embargo, la ausencia de sesgo no es esencial. A menudo, si se permite un pequeño sesgo, se puede encontrar un estimador con un error cuadrático medio menor y/o menos estimaciones de muestras atípicas.

Una alternativa a la versión "insesgada" anterior es la "mediana insesgada", donde la mediana de la distribución de las estimaciones coincide con el valor verdadero; por lo tanto, a largo plazo, la mitad de las estimaciones serán demasiado bajas y la otra mitad demasiado altas. Si bien esto se aplica inmediatamente solo a estimadores escalares, puede extenderse a cualquier medida de tendencia central de una distribución: véase estimadores mediana insesgados .

En un problema práctico,θ^{\displaystyle {\widehat {\theta }}}siempre puede tener una relación funcional conθ{\displaystyle \theta }Por ejemplo, si una teoría genética afirma que hay un tipo de hoja (verde almidonada) que aparece con probabilidadpag1=1/4(θ+2){\displaystyle p_{1}=1/4\cdot (\theta +2)}, con0<θ<1{\displaystyle 0<\theta <1}. Entonces, paranorte{\displaystyle n}hojas, la variable aleatorianorte1{\displaystyle N_{1}}, o el número de hojas verdes almidonadas, se puede modelar con unBinorte(norte,pag1){\displaystyle \mathrm {Bin} (n,p_{1})}distribución. El número se puede utilizar para expresar el siguiente estimador paraθ{\displaystyle \theta }:θ^=4/nortenorte12{\displaystyle {\widehat {\theta }}=4/n\cdot N_{1}-2}Se puede demostrar queθ^{\displaystyle {\widehat {\theta }}}es un estimador insesgado paraθ{\displaystyle \theta }: mi[θ^]=mi[4/nortenorte12]=4/nortemi[norte1]2=4/nortenortepag12=4pag12=41/4(θ+2)2=θ+22=θ.{\displaystyle {\begin{aligned}\operatorname {E} [{\widehat {\theta }}]&=\operatorname {E} [4/n\cdot N_{1}-2]=4/n\cdot \operatorname {E} [N_{1}]-2\\[1ex]&=4/n\cdot np_{1}-2=4\cdot p_{1}-2\\[1ex]&=4\cdot 1/4\cdot (\theta +2)-2=\theta +2-2\\[1ex]&=\theta .\end{aligned}}}

Imparcialidad

Diferencia entre estimadores: un estimador insesgadoθ2{\displaystyle \theta _{2}}está centrado enθ{\displaystyle \theta }frente a un estimador sesgadoθ1{\displaystyle \theta _{1}}.

Una propiedad deseable para los estimadores es la insesgadez, es decir, que un estimador no tenga una tendencia sistemática a producir estimaciones mayores o menores que el parámetro verdadero. Además, se prefieren los estimadores insesgados con menor varianza a aquellos con mayor varianza, ya que estarán más cerca del valor "verdadero" del parámetro. El estimador insesgado con la menor varianza se conoce como estimador insesgado de mínima varianza (MVUE).

Para averiguar si un estimadorθ^{\displaystyle {\widehat {\theta }}}es imparcial, es fácil seguir la ecuaciónmi[θ^]θ=0{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta =0}. Con estimador T con y parámetro de interésθ{\displaystyle \theta }Resolviendo la ecuación anterior, se muestra comomi[T]=θ{\displaystyle \operatorname {E} [T]=\theta }El estimador es insesgado. Al observar la figura de la derecha, a pesar deθ^2{\displaystyle {\hat {\theta }}_{2}}siendo el único estimador insesgado, si las distribuciones se superponían y ambas estaban centradas enθ{\displaystyle \theta }luego distribuciónθ^1{\displaystyle {\hat {\theta }}_{1}}En realidad, sería el estimador imparcial preferido.

Expectativa Al observar cantidades en interés de la expectativa para la distribución del modelo hay un estimador insesgado que debe satisfacer las dos ecuaciones siguientes.

Varianza De manera similar, al observar cantidades en interés de la varianza como distribución del modelo, también existe un estimador insesgado que debe satisfacer las dos ecuaciones siguientes.

Nótese que estamos dividiendo por n  1 porque si dividiéramos con n obtendríamos un estimador con un sesgo negativo que produciría estimaciones demasiado pequeñas paraσ2{\displaystyle \sigma ^{2}}También cabe mencionar que, aunqueSnorte2{\displaystyle S_{n}^{2}}es imparcial paraσ2{\displaystyle \sigma ^{2}}Lo contrario no es cierto. [ 4 ]

Relaciones entre las cantidades

  • El error cuadrático medio, la varianza y el sesgo están relacionados:MSE(θ^)=Var(θ^)+(B(θ^))2,{\displaystyle \operatorname {MSE} ({\widehat {\theta }})=\operatorname {Var} ({\widehat {\theta }})+(B({\widehat {\theta }}))^{2},}Es decir, el error cuadrático medio = varianza + cuadrado del sesgo. En particular, para un estimador insesgado, la varianza es igual al error cuadrático medio.
  • La desviación estándar de un estimadorθ^{\displaystyle {\widehat {\theta }}}deθ{\displaystyle \theta }(la raíz cuadrada de la varianza), o una estimación de la desviación estándar de un estimadorθ^{\displaystyle {\widehat {\theta }}}deθ{\displaystyle \theta }, se denomina error estándar deθ^{\displaystyle {\widehat {\theta }}}.
  • La compensación entre sesgo y varianza se utilizará en la complejidad del modelo, el sobreajuste y el subajuste. Se emplea principalmente en el campo del aprendizaje supervisado y el modelado predictivo para diagnosticar el rendimiento de los algoritmos.

Ejemplo

Consideremos una variable aleatoria que sigue una distribución de probabilidad normal.incógnitanorte(μ,σ2){\displaystyle X\sim {\mathcal {N}}(\mu ,\sigma ^{2})}y un estimador sesgado de la mediaμ=θ{\displaystyle \mu =\theta }de esa distribución θ^(incógnita)=incógnita¯norte+B=1nortei=1norteincógnitai+B,{\displaystyle {\hat {\theta }}(X)={\bar {X}}_{n}+B={\frac {1}{n}}\sum _{i=1}^{n}X_{i}+B,} dóndeB{\displaystyle B}sigue una distribución degenerada , es decirPAG(B=b)=1{\displaystyle P(B=b)=1}, de tal manera que mi[θ^(incógnita)]=mi[incógnita¯norte]+mi[B]=μ+b,{\displaystyle \mathrm {E} [{\hat {\theta }}(X)]=\mathrm {E} [{\bar {X}}_{n}]+\mathrm {E} [B]=\mu +b,}B(θ^(incógnita))=b,{\displaystyle \mathrm {B} ({\hat {\theta }}(X))=b,}Var(θ^(incógnita))=mi[(incógnita¯norte+Bμb)2]=mi[(incógnita¯norteμ)2]+mi[(Bb)2]+2mi[(incógnita¯norteμ)(Bb)]=Var(incógnita¯norteμ)+mi[(incógnita¯norteμ)2]+Var(Bb)+mi[(Bb)2]+2doov(incógnita¯norteμ,Bb)||2Var(incógnita¯norteμ)Var(Bb)=0+2mi[incógnita¯norteμ]mi[Bb]=σ2norte,{\displaystyle {\begin{aligned}\mathrm {Var} ({\hat {\theta }}(X))&=\mathrm {E} [({\bar {X}}_{n}+B-\mu -b)^{2}]\\[2ex]&={\color [rgb]{0.12156862745098039,0.4666666666666667,0.7058823529411765}\mathrm {E} [({\bar {X}}_{n}-\mu )^{2}]}+{\color [rgb]{1,0.4980392156862745,0.054901960784313725}\mathrm {E} [(B-b)^{2}]}+{\color [rgb]{0.17254901960784313,0.6274509803921569,0.17254901960784313}2\mathrm {E} [({\bar {X}}_{n}-\mu )(B-b)]}\\[2ex]&={\color [rgb]{0.12156862745098039,0.4666666666666667,0.7058823529411765}\mathrm {Var} ({\bar {X}}_{n}-\mu )+\mathrm {E} [({\bar {X}}_{n}-\mu )^{2}]}+{\color [rgb]{1,0.4980392156862745,0.054901960784313725}\mathrm {Var} (B-b)+\mathrm {E} [(B-b)^{2}]}\\[0.5ex]&\qquad {}+{\color [rgb]{0.17254901960784313,0.6274509803921569,0.17254901960784313}2\underbrace {\mathrm {Cov} ({\bar {X}}_{n}-\mu ,B-b)} _{|\cdots |^{2}\leqslant \mathrm {Var} ({\bar {X}}_{n}-\mu )\mathrm {Var} (B-b)=0}+2\mathrm {E} [{\bar {X}}_{n}-\mu ]\mathrm {E} [B-b]}\\&={\frac {\sigma ^{2}}{n}},\end{aligned}}} donde todos los términos son cero exceptoVar(incógnita¯norteμ)=Var(incógnita¯norte)=σ2norte{\displaystyle \mathrm {Var} ({\bar {X}}_{n}-\mu )=\mathrm {Var} ({\bar {X}}_{n})={\frac {\sigma ^{2}}{n}}}utilizando la fórmula de Bienaymé y METROSmi(θ^(incógnita))=mi[(incógnita¯norte+Bμ)2]=mi[(incógnita¯norteμ)2]+mi[B2]=σ2norte+b2.{\displaystyle \mathrm {MSE} ({\hat {\theta }}(X))=\mathrm {E} [({\bar {X}}_{n}+B-\mu )^{2}]=\mathrm {E} [({\bar {X}}_{n}-\mu )^{2}]+\mathrm {E} [B^{2}]={\frac {\sigma ^{2}}{n}}+b^{2}.} Verificamos la relación entre el error cuadrático medio, la varianza y el sesgo. A continuación se ilustran las propiedades cuantificadas de la estimación de la media de la distribución de probabilidad, tomando como referenciaμ=0{\displaystyle \mu =0},σ=1{\displaystyle \sigma =1}yb=1/2{\displaystyle b=1/2}.

Función de densidad de probabilidadϕ{\displaystyle \phi }de la distribución normal estándar (azul) con una muestra{incógnitai}norte{\displaystyle \{x_{i}\}_{n}}denorte=10{\displaystyle n=10}valores ({\displaystyle {\color [rgb]{1,0.4980392156862745,0.054901960784313725}\bullet }}) y la estimación asociadaθ^({incógnitai}norte){\displaystyle {\hat {\theta }}(\{x_{i}\}_{n})}({\displaystyle {\color [rgb]{0.17254901960784313,0.6274509803921569,0.17254901960784313}\blacksquare }}). La mediaθ=0{\displaystyle \theta =0}de la distribución original y la mediami(θ^)=1/2{\displaystyle \mathrm {E} ({\hat {\theta }})=1/2}También se muestran los valores del estimador (que son la media de su distribución muestral, véase la imagen de la derecha), junto con el error.mi{\displaystyle e}y desviación de muestreod{\displaystyle d}.
Distribución muestral del estimadorθ^(incógnita){\displaystyle {\hat {\theta }}(X)}con media, varianza (cuadrado del error estándar ) y error cuadrático medio. En rojo se muestra la distribución exacta conocida cuando la distribución original es normal y el estimador es la media muestral (sesgada). En verde se muestra el histograma de 20 000 estimaciones. El histograma converge a la distribución exacta en el límite de muestras infinitas. Cabe destacar que, para un número dado de estimaciones, el teorema del límite central garantiza que la distribución de la estimación de la media muestral (sesgada) también converge a la distribución exacta en el límite de tamaño de muestra infinito.

Propiedades de comportamiento

Consistencia

Un estimador consistente es aquel cuya secuencia de estimaciones converge en probabilidad a la cantidad que se está estimando a medida que el índice (generalmente el tamaño de la muestra ) crece indefinidamente. En otras palabras, aumentar el tamaño de la muestra incrementa la probabilidad de que el estimador se aproxime al parámetro poblacional.

Matemáticamente, un estimador es un estimador consistente para el parámetroθ{\displaystyle \theta }, si y solo si para la secuencia de estimaciones{tnorte:nortenorte}{\displaystyle \{t_{n}:n\in \mathbb {N} \}}y para todosε>0{\displaystyle \varepsilon >0}, por muy pequeños que sean, tenemos límitenortePr{|tnorteθ|ε}=1.{\displaystyle \lim _{n\to \infty }\Pr \left\{\left|t_{n}-\theta \right|\leq \varepsilon \right\}=1.}La consistencia definida anteriormente puede denominarse consistencia débil. La sucesión es fuertemente consistente si converge casi con seguridad al valor verdadero.

Un estimador que converge a un múltiplo de un parámetro puede convertirse en un estimador consistente multiplicándolo por un factor de escala , es decir, el valor verdadero dividido por el valor asintótico del estimador. Esto ocurre con frecuencia en la estimación de parámetros de escala mediante medidas de dispersión estadística .

Consistencia de Fisher

Un estimador puede considerarse consistente en el sentido de Fisher siempre que sea el mismo funcional de la función de distribución empírica que la función de distribución verdadera. Siguiendo la fórmula: θ^=h(Tnorte),θ=h(Tθ){\displaystyle {\widehat {\theta }}=h(T_{n}),\theta =h(T_{\theta })} DóndeTnorte{\displaystyle T_{n}}yTθ{\displaystyle T_{\theta }}son la función de distribución empírica y la función de distribución teórica, respectivamente. Un ejemplo sencillo para comprobar si un estimador es consistente con Fisher es verificar la consistencia de la media y la varianza. Por ejemplo, para comprobar la consistencia de la mediaμ^=incógnita¯{\displaystyle {\widehat {\mu }}={\bar {X}}}y para comprobar la varianza confirme queσ^2=SSD/norte{\displaystyle {\widehat {\sigma }}^{2}=SSD/n}. [ 5 ]

normalidad asintótica

Un estimador asintóticamente normal es un estimador consistente cuya distribución alrededor del parámetro verdaderoθ{\displaystyle \theta }se aproxima a una distribución normal con desviación estándar que disminuye en proporción a1/norte{\displaystyle 1/{\sqrt {n}}}como tamaño de la muestranorte{\displaystyle n}crece. UsandoD{\displaystyle {\xrightarrow {D}}}para denotar convergencia en distribución , un estimadortnorte{\displaystyle t_{n}}es asintóticamente normal si norte(tnorteθ) D norte(0,V),{\displaystyle {\sqrt {n}}(t_{n}-\theta )\ \xrightarrow {D} \ N(0,V),} para algunosV{\displaystyle V}.

En esta formulaciónV/norte{\displaystyle V/n}puede denominarse la varianza asintótica del estimador. Sin embargo, algunos autores también la denominanV{\displaystyle V}la varianza asintótica . [ 6 ] Nótese que la convergencia no necesariamente habrá ocurrido para ningún valor finito.norte{\displaystyle n}, por lo tanto, este valor es solo una aproximación a la verdadera varianza del estimador, mientras que en el límite la varianza asintóticaV/norte{\displaystyle V/n}es simplemente cero. En particular, la distribución del estimadortnorte{\displaystyle t_{n}}converge débilmente a una función delta de Dirac centrada enθ{\displaystyle \theta }.

Bajo condiciones leves sobre la distribución de los datos, el teorema del límite central implica la normalidad asintótica de la media muestral.incógnita¯{\displaystyle {\bar {X}}}como estimador de la media verdadera. En términos más generales, los estimadores de máxima verosimilitud son asintóticamente normales bajo condiciones de regularidad bastante débiles (véase la sección de asintótica del artículo sobre máxima verosimilitud). Sin embargo, no todos los estimadores son asintóticamente normales; los ejemplos más sencillos se dan cuando el valor verdadero de un parámetro se encuentra en el límite de la región de parámetros permitida.

Eficiencia

La eficiencia de un estimador se utiliza para estimar la cantidad de interés de manera que se minimice el error. En realidad, no existe un estimador óptimo explícito; solo puede existir un estimador mejor. Si la eficiencia de un estimador es mejor o no se basa en la elección de una función de pérdida particular , y se refleja en dos propiedades naturalmente deseables de los estimadores: ser insesgadomi[θ^]θ=0{\displaystyle \operatorname {E} [{\widehat {\theta }}]-\theta =0}y tener un error cuadrático medio (ECM) mínimo.mi[(θ^θ)2]{\displaystyle \operatorname {E} [({\widehat {\theta }}-\theta )^{2}]}. En general, estas dos condiciones no pueden satisfacerse simultáneamente: un estimador sesgado puede tener un error cuadrático medio menor que cualquier estimador insesgado (véase sesgo del estimador ).

Esta ecuación relaciona el error cuadrático medio con el sesgo del estimador: [ 4 ]mi[(θ^θ)2]=(mi[θ^]θ)2+Var(θ^){\displaystyle \operatorname {E} [({\widehat {\theta }}-\theta )^{2}]=\left(\operatorname {E} [{\widehat {\theta }}]-\theta \right)^{2}+\operatorname {Var} ({\widehat {\theta }})}El primer término representa el error cuadrático medio; el segundo término representa el cuadrado del sesgo del estimador; y el tercer término representa la varianza del estimador. La calidad del estimador se puede identificar a partir de la comparación entre la varianza, el cuadrado del sesgo del estimador o el ECM. La varianza del buen estimador (buena eficiencia) sería menor que la varianza del mal estimador (mala eficiencia). El cuadrado del sesgo de un estimador con un buen estimador sería menor que el sesgo del estimador con un mal estimador. El ECM de un buen estimador sería menor que el ECM del mal estimador. Supongamos que hay dos estimadores,θ^1{\displaystyle {\widehat {\theta }}_{1}}es el buen estimador yθ^2{\displaystyle {\widehat {\theta }}_{2}}es el mal estimador. La relación anterior se puede expresar mediante las siguientes fórmulas:Var(θ^1)<Var(θ^2),|mi(θ^1)θ|<|mi(θ^2)θ|,MSE(θ^1)<MSE(θ^2).{\displaystyle {\begin{aligned}&\operatorname {Var} ({\widehat {\theta }}_{1})<\operatorname {Var} ({\widehat {\theta }}_{2}),\\[0.2cm]&\left|\operatorname {E} ({\widehat {\theta }}_{1})-\theta \right|<\left|\operatorname {E} ({\widehat {\theta }}_{2})-\theta \right|,\\[0.2cm]&\operatorname {MSE} ({\widehat {\theta }}_{1})<\operatorname {MSE} ({\widehat {\theta }}_{2}).\end{aligned}}}Además de utilizar fórmulas para identificar la eficiencia del estimador, también se puede identificar mediante un gráfico. Si un estimador es eficiente, en el gráfico de frecuencia frente a valor, habrá una curva con alta frecuencia en el centro y baja frecuencia en los extremos. Por ejemplo:

Si un estimador no es eficiente, en el gráfico de frecuencia frente a valor, habrá una curva relativamente más suave.

En pocas palabras, el buen estimador tiene una curva estrecha, mientras que el mal estimador tiene una curva ancha. Al representar gráficamente estas dos curvas con un eje Y común , la diferencia se hace más evidente.

Comparación entre un buen estimador y uno malo

Entre los estimadores insesgados, suele existir uno con la menor varianza, denominado estimador insesgado de varianza mínima ( MVUE ). En algunos casos, existe un estimador eficiente insesgado que, además de tener la menor varianza entre los estimadores insesgados, satisface la cota de Cramér-Rao , que es una cota inferior absoluta para la varianza de las estadísticas de una variable.

En relación con dichos "mejores estimadores insesgados", véase también la cota de Cramér-Rao , el teorema de Gauss-Markov , el teorema de Lehmann-Scheffé y el teorema de Rao-Blackwell .

Robustez

Véase también

Referencias

  1. Mosteller, F.; Tukey, JW (1987) [1968]. «Análisis de datos, incluyendo estadística» . Obras completas de John W. Tukey: Filosofía y principios del análisis de datos 1965–1986 . Vol.  4. CRC Press. pp.  601–720 [p. 633]. ISBN 0-534-05101-4 vía Google Libros .
  2. ^ Kosorok (2008), sección 3.1, págs. 35–39.
  3. Jaynes (2007), pág. 172.
  4. ^ Dekking , Frederik Michel; Kraaikamp, ​​Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). Una introducción moderna a la probabilidad y la estadística . Textos Springer en Estadística. ISBN 978-1-85233-896-1.
  5. Lauritzen, Steffen. "Propiedades de los estimadores" (PDF) . Universidad de Oxford . Consultado el 9 de diciembre de 2023 .
  6. Casella y Berger (2002), pág. 471

Lecturas adicionales

  • Bol'shev, Login Nikolaevich (2001) [1994], "Estimador estadístico" , Enciclopedia de Matemáticas , EMS Press.
  • Casella, George; Berger, Roger L. (2002). Inferencia estadística (2ª  ed.). Duxbury.
  • Jaynes, ET (2007). Teoría de la probabilidad: La lógica de la ciencia (5.ª  ed.). Cambridge University Press . ISBN 978-0-521-59271-0..
  • Kosorok, Michael (2008). Introducción a los procesos empíricos y la inferencia semiparamétrica . Springer Series in Statistics. Springer . doi : 10.1007/978-0-387-74978-5 . ISBN 978-0-387-74978-5.
  • Lehmann, EL ; Casella, G. (1998). Teoría de la estimación puntual (2.ª  ed.). Springer . ISBN 0-387-98502-6.
  • Shao, Jun (1998), Estadística matemática , Springer , ISBN 0-387-98674-X
  • Fundamentos de la teoría de la estimación