Articulo de referencia

Estimador invariante

En estadística , el concepto de estimador invariante es un criterio que se puede usar para comparar las propiedades de diferentes estimadores para la misma cantidad. Es una form...

En estadística , el concepto de estimador invariante es un criterio que se puede usar para comparar las propiedades de diferentes estimadores para la misma cantidad. Es una forma de formalizar la idea de que un estimador debe tener ciertas cualidades intuitivamente atractivas. Estrictamente hablando, "invariante" significaría que las estimaciones en sí mismas no cambian cuando tanto las mediciones como los parámetros se transforman de manera compatible, pero el significado se ha extendido para permitir que las estimaciones cambien de maneras apropiadas con tales transformaciones. [ 1 ] El término estimador equivariante se usa en contextos matemáticos formales que incluyen una descripción precisa de la relación de cómo cambia el estimador en respuesta a cambios en el conjunto de datos y la parametrización: esto corresponde al uso de " equivariancia " en matemáticas más generales.

Configuración general

Fondo

En inferencia estadística , existen varios enfoques de la teoría de la estimación que permiten determinar de inmediato qué estimadores deben utilizarse. Por ejemplo, las ideas de la inferencia bayesiana conducen directamente a los estimadores bayesianos . De manera similar, la teoría de la inferencia estadística clásica a veces permite llegar a conclusiones sólidas sobre qué estimador debe utilizarse. Sin embargo, la utilidad de estas teorías depende de contar con un modelo estadístico completamente definido y también puede depender de tener una función de pérdida relevante para determinar el estimador. Así, se podría realizar un análisis bayesiano , que dé lugar a una distribución posterior para los parámetros relevantes, pero el uso de una función de utilidad o pérdida específica puede resultar poco claro. En ese caso, se pueden aplicar ideas de invariancia para resumir la distribución posterior. En otros casos, se realizan análisis estadísticos sin un modelo estadístico completamente definido o la teoría clásica de la inferencia estadística no se puede aplicar fácilmente porque la familia de modelos que se está considerando no se presta a tal tratamiento. Además de estos casos en los que la teoría general no prescribe un estimador, el concepto de invariancia de un estimador puede aplicarse al buscar estimadores de formas alternativas, ya sea por el bien de la simplicidad de la aplicación del estimador o para que el estimador sea robusto .

El concepto de invarianza se utiliza a veces de forma aislada para elegir entre estimadores, pero esto no es necesariamente definitivo. Por ejemplo, el requisito de invarianza puede ser incompatible con el requisito de que el estimador sea insesgado respecto a la media ; por otro lado, el criterio de insesgadez respecto a la mediana se define en términos de la distribución muestral del estimador y, por lo tanto, es invariante ante muchas transformaciones.

Una aplicación del concepto de invariancia se da cuando se propone una clase o familia de estimadores y se debe seleccionar una formulación específica entre ellos. Un procedimiento consiste en imponer las propiedades de invariancia pertinentes y, a continuación, encontrar la formulación dentro de esta clase que posea las mejores propiedades, lo que da lugar a lo que se denomina el estimador invariante óptimo.

Algunas clases de estimadores invariantes

Existen varios tipos de transformaciones que resultan útiles al trabajar con estimadores invariantes. Cada una da lugar a una clase de estimadores que son invariantes a esos tipos particulares de transformación.

  • Invariancia ante cambios: En teoría, las estimaciones de un parámetro de localización deberían ser invariantes ante cambios simples en los valores de los datos. Si todos los valores de los datos aumentan en una cantidad determinada, la estimación debería cambiar en la misma cantidad. Al considerar la estimación mediante un promedio ponderado , este requisito de invariancia implica inmediatamente que la suma de los pesos debe ser igual a uno. Si bien a menudo se obtiene el mismo resultado a partir de un requisito de insesgadez, el uso de "invariancia" no requiere la existencia de un valor medio ni utiliza ninguna distribución de probabilidad.
  • Invariancia de escala: Cabe señalar que este tema sobre la invariancia del parámetro de escala del estimador no debe confundirse con la invariancia de escala más general sobre el comportamiento de los sistemas bajo propiedades agregadas (en física).
  • Invariancia de transformación de parámetros: Aquí, la transformación se aplica solo a los parámetros. El concepto es que esencialmente se debe realizar la misma inferencia a partir de datos y un modelo que involucre un parámetro θ que a partir de los mismos datos si el modelo utilizara un parámetro φ, donde φ es una transformación biyectiva de θ, φ = h (θ). Según este tipo de invariancia, los resultados de los estimadores invariantes a la transformación también deben estar relacionados por φ = h (θ). Los estimadores de máxima verosimilitud tienen esta propiedad cuando la transformación es monótona . Aunque las propiedades asintóticas del estimador pueden ser invariantes, las propiedades para muestras pequeñas pueden ser diferentes, y es necesario derivar una distribución específica. [ 2 ]
  • Invariancia de permutación: Cuando un conjunto de valores de datos puede representarse mediante un modelo estadístico que los representa como resultados de variables aleatorias independientes e idénticamente distribuidas , es razonable imponer el requisito de que cualquier estimador de cualquier propiedad de la distribución común sea invariante a la permutación: específicamente, que el estimador, considerado como una función del conjunto de valores de datos, no cambie si se intercambian elementos de datos dentro del conjunto de datos.

La combinación de invariancia de permutación e invariancia de localización para estimar un parámetro de localización a partir de un conjunto de datos independiente e idénticamente distribuido mediante un promedio ponderado implica que los pesos deben ser idénticos y sumar uno. Por supuesto, otros estimadores distintos al promedio ponderado pueden ser preferibles.

Estimadores invariantes óptimos

En este contexto, se nos proporciona un conjunto de medidas.incógnita{\displaystyle x}que contiene información sobre un parámetro desconocidoθ{\displaystyle \theta }Las medidasincógnita{\displaystyle x}se modelan como una variable aleatoria vectorial que tiene una función de densidad de probabilidadF(incógnita|θ){\displaystyle f(x|\theta )}que depende de un vector de parámetrosθ{\displaystyle \theta }.

El problema es estimarθ{\displaystyle \theta }dadoincógnita{\displaystyle x}. La estimación, denotada pora{\displaystyle a}es una función de las mediciones y pertenece a un conjuntoA{\displaystyle A}La calidad del resultado se define mediante una función de pérdida .L=L(a,θ){\displaystyle L=L(a,\theta )}que determina una función de riesgoR=R(a,θ)=mi[L(a,θ)|θ]{\displaystyle R=R(a,\theta )=E[L(a,\theta )|\theta ]}. Los conjuntos de valores posibles deincógnita{\displaystyle x},θ{\displaystyle \theta }, ya{\displaystyle a}se denotan porincógnita{\displaystyle X},Θ{\displaystyle \Theta }, yA{\displaystyle A}, respectivamente.

En la clasificación

En la clasificación estadística , la regla que asigna una clase a un nuevo elemento de datos puede considerarse un tipo especial de estimador. Se pueden aplicar diversas consideraciones de invariancia al formular el conocimiento previo para el reconocimiento de patrones .

Contexto matemático

Definición

Un estimador invariante es un estimador que obedece las dos reglas siguientes:

  1. Principio de invariancia racional: La acción tomada en un problema de decisión no debe depender de la transformación de la medida utilizada.
  2. Principio de invariancia: Si dos problemas de decisión tienen la misma estructura formal (en términos deincógnita{\displaystyle X},Θ{\displaystyle \Theta },F(incógnita|θ){\displaystyle f(x|\theta )}yL{\displaystyle L}), entonces se debe utilizar la misma regla de decisión en cada problema.

Para definir formalmente un estimador invariante o equivariante, primero se necesitan algunas definiciones relacionadas con grupos de transformaciones. Seaincógnita{\displaystyle X}denota el conjunto de posibles muestras de datos. Un grupo de transformaciones deincógnita{\displaystyle X}, que se denotará porGRAMO{\displaystyle G}, es un conjunto de transformaciones (medibles) 1:1 y sobreyectivas deincógnita{\displaystyle X}en sí mismo, que satisface las siguientes condiciones:

  1. Sigramo1GRAMO{\displaystyle g_{1}\in G} ygramo2GRAMO{\displaystyle g_{2}\in G}entoncesgramo1gramo2GRAMO{\displaystyle g_{1}g_{2}\in G\,}
  2. SigramoGRAMO{\displaystyle g\in G}entoncesgramo1GRAMO{\displaystyle g^{-1}\in G}, dóndegramo1(gramo(incógnita))=incógnita.{\displaystyle g^{-1}(g(x))=x\,.}(Es decir, cada transformación tiene una inversa dentro del grupo).
  3. miGRAMO{\displaystyle e\in G}(es decir, hay una transformación de identidad)mi(incógnita)=incógnita{\displaystyle e(x)=x\,})

conjuntos de datosincógnita1{\displaystyle x_{1}}yincógnita2{\displaystyle x_{2}}enincógnita{\displaystyle X}son equivalentes siincógnita1=gramo(incógnita2){\displaystyle x_{1}=g(x_{2})}para algunosgramoGRAMO{\displaystyle g\in G}. Todos los puntos equivalentes forman una clase de equivalencia . Dicha clase de equivalencia se llama órbita (enincógnita{\displaystyle X}). Elincógnita0{\displaystyle x_{0}}órbita,incógnita(incógnita0){\displaystyle X(x_{0})}, es el conjuntoincógnita(incógnita0)={gramo(incógnita0):gramoGRAMO}{\displaystyle X(x_{0})=\{g(x_{0}):g\in G\}}. Siincógnita{\displaystyle X}consta de una sola órbita entoncesgramo{\displaystyle g}Se dice que es transitivo.

Una familia de densidadesF{\displaystyle F}Se dice que es invariante bajo el grupoGRAMO{\displaystyle G}si, por cadagramoGRAMO{\displaystyle g\in G}yθΘ{\displaystyle \theta \in \Theta }existe un únicoθΘ{\displaystyle \theta ^{*}\in \Theta }de tal manera queY=gramo(incógnita){\displaystyle Y=g(x)}tiene densidadF(y|θ){\displaystyle f(y|\theta ^{*})}.θ{\displaystyle \theta ^{*}}se denotarágramo¯(θ){\displaystyle {\bar {g}}(\theta )}.

SiF{\displaystyle F}es invariante bajo el grupoGRAMO{\displaystyle G}luego la función de pérdidaL(θ,a){\displaystyle L(\theta ,a)}Se dice que es invariante bajoGRAMO{\displaystyle G}si por cadagramoGRAMO{\displaystyle g\in G}yaA{\displaystyle a\in A}existe unaA{\displaystyle a^{*}\in A}de tal manera queL(θ,a)=L(gramo¯(θ),a){\displaystyle L(\theta ,a)=L({\bar {g}}(\theta ),a^{*})}a pesar deθΘ{\displaystyle \theta \in \Theta }. El valor transformadoa{\displaystyle a^{*}}se denotará porgramo~(a){\displaystyle {\tilde {g}}(a)}.

En lo anterior,GRAMO¯={gramo¯:gramoGRAMO}{\displaystyle {\bar {G}}=\{{\bar {g}}:g\in G\}}es un grupo de transformaciones deΘ{\displaystyle \Theta }a sí mismo yGRAMO~={gramo~:gramoGRAMO}{\displaystyle {\tilde {G}}=\{{\tilde {g}}:g\in G\}}es un grupo de transformaciones deA{\displaystyle A}a sí mismo.

Un problema de estimación es invariante (equivariante) bajoGRAMO{\displaystyle G}si existen tres gruposGRAMO,GRAMO¯,GRAMO~{\displaystyle G,{\bar {G}},{\tilde {G}}}como se definió anteriormente.

Para un problema de estimación que es invariante bajoGRAMO{\displaystyle G}estimadorδ(incógnita){\displaystyle \delta (x)}es un estimador invariante bajoGRAMO{\displaystyle G}si, para todosincógnitaincógnita{\displaystyle x\in X}ygramoGRAMO{\displaystyle g\in G},

δ(gramo(incógnita))=gramo~(δ(incógnita)).{\displaystyle \delta (g(x))={\tilde {g}}(\delta (x)).}

Propiedades

  1. La función de riesgo de un estimador invariante,δ{\displaystyle \delta }, es constante en las órbitas deΘ{\displaystyle \Theta }. EquivalentementeR(θ,δ)=R(gramo¯(θ),δ){\displaystyle R(\theta ,\delta )=R({\bar {g}}(\theta ),\delta )}a pesar deθΘ{\displaystyle \theta \in \Theta }ygramo¯GRAMO¯{\displaystyle {\bar {g}}\in {\bar {G}}}.
  2. La función de riesgo de un estimador invariante con transitividadgramo¯{\displaystyle {\bar {g}}}es constante.

Para un problema dado, el estimador invariante con el menor riesgo se denomina "mejor estimador invariante". El mejor estimador invariante no siempre se puede lograr. Un caso especial para el cual se puede lograr es el caso en el quegramo¯{\displaystyle {\bar {g}}}es transitivo.

Ejemplo: Parámetro de ubicación

Suponerθ{\displaystyle \theta }es un parámetro de ubicación si la densidad deincógnita{\displaystyle X}es de la formaF(incógnitaθ){\displaystyle f(x-\theta )}. ParaΘ=A=R1{\displaystyle \Theta =A=\mathbb {R} ^{1}}yL=L(aθ){\displaystyle L=L(a-\theta )}, el problema es invariante bajogramo=gramo¯=gramo~={gramodo:gramodo(incógnita)=incógnita+do,doR}{\displaystyle g={\bar {g}}={\tilde {g}}=\{g_{c}:g_{c}(x)=x+c,c\in \mathbb {R} \}}El estimador invariante en este caso debe satisfacer

δ(incógnita+do)=δ(incógnita)+do, a pesar de doR,{\displaystyle \delta (x+c)=\delta (x)+c,{\text{ for all }}c\in \mathbb {R} ,}

así es de la formaδ(incógnita)=incógnita+K{\displaystyle \delta (x)=x+K}(KR{\displaystyle K\in \mathbb {R} }).gramo¯{\displaystyle {\bar {g}}}es transitivo enΘ{\displaystyle \Theta }por lo que el riesgo no varía conθ{\displaystyle \theta }: eso es,R(θ,δ)=R(0,δ)=mi[L(incógnita+K)|θ=0]{\displaystyle R(\theta ,\delta )=R(0,\delta )=\operatorname {E} [L(X+K)|\theta =0]}El mejor estimador invariante es el que trae el riesgoR(θ,δ){\displaystyle R(\theta ,\delta )}al mínimo.

En el caso de que L sea el error al cuadradoδ(incógnita)=incógnitami[incógnita|θ=0].{\displaystyle \delta (x)=x-\operatorname {E} [X|\theta =0].}

Estimador Pitman

El problema de estimación es queincógnita=(incógnita1,,incógnitanorte){\displaystyle X=(X_{1},\dots ,X_{n})}tiene densidadF(incógnita1θ,,incógnitanorteθ){\displaystyle f(x_{1}-\theta ,\dots ,x_{n}-\theta )}, donde θ es un parámetro a estimar y donde la función de pérdida esL(|aθ|){\displaystyle L(|a-\theta |)}Este problema es invariante con los siguientes grupos de transformaciones (aditivas):

GRAMO={gramodo:gramodo(incógnita)=(incógnita1+do,,incógnitanorte+do),doR1},{\displaystyle G=\{g_{c}:g_{c}(x)=(x_{1}+c,\dots ,x_{n}+c),c\in \mathbb {R} ^{1}\},}
GRAMO¯={gramodo:gramodo(θ)=θ+do,doR1},{\displaystyle {\bar {G}}=\{g_{c}:g_{c}(\theta )=\theta +c,c\in \mathbb {R} ^{1}\},}
GRAMO~={gramodo:gramodo(a)=a+do,doR1}.{\displaystyle {\tilde {G}}=\{g_{c}:g_{c}(a)=a+c,c\in \mathbb {R} ^{1}\}.}

El mejor estimador invarianteδ(incógnita){\displaystyle \delta (x)}es el que minimiza

L(δ(incógnita)θ)F(incógnita1θ,,incógnitanorteθ)dθF(incógnita1θ,,incógnitanorteθ)dθ,{\displaystyle {\frac {\int _{-\infty }^{\infty }L(\delta (x)-\theta )f(x_{1}-\theta ,\dots ,x_{n}-\theta )d\theta }{\int _{-\infty }^{\infty }f(x_{1}-\theta ,\dots ,x_{n}-\theta )d\theta }},}

y este es el estimador de Pitman (1939).

Para el caso de pérdida de error cuadrático, el resultado es

δ(incógnita)=θF(incógnita1θ,,incógnitanorteθ)dθF(incógnita1θ,,incógnitanorteθ)dθ.{\displaystyle \delta (x)={\frac {\int _{-\infty }^{\infty }\theta f(x_{1}-\theta ,\dots ,x_{n}-\theta )d\theta }{\int _{-\infty }^{\infty }f(x_{1}-\theta ,\dots ,x_{n}-\theta )d\theta }}.}

Siincógnitanorte(θ1norte,I){\displaystyle x\sim N(\theta 1_{n},I)\,\!}(es decir, una distribución normal multivariada con componentes independientes de varianza unitaria) entonces

δMinero=δMETROL=incógnitainorte.{\displaystyle \delta _{\text{Pitman}}=\delta _{ML}={\frac {\sum {x_{i}}}{n}}.}

Siincógnitado(θ1norte,Iσ2){\displaystyle x\sim C(\theta 1_{n},I\sigma ^{2})\,\!}(componentes independientes que tienen una distribución de Cauchy con parámetro de escala σ ) entonces δMineroδMETROL{\displaystyle \delta _{\text{Pitman}}\neq \delta _{ML}},. Sin embargo, el resultado es

δMinero=k=1norteincógnitak[Re{wk}metro=1norteRe{wk}],norte>1,{\displaystyle \delta _{\text{Pitman}}=\sum _{k=1}^{n}{x_{k}\left[{\frac {{\text{Re}}\{w_{k}\}}{\sum _{m=1}^{n}{{\text{Re}}\{w_{k}\}}}}\right]},\qquad n>1,}

con

wk=jk[1(incógnitakincógnitaj)2+4σ2][12σ(incógnitakincógnitaj)i].{\displaystyle w_{k}=\prod _{j\neq k}\left[{\frac {1}{(x_{k}-x_{j})^{2}+4\sigma ^{2}}}\right]\left[1-{\frac {2\sigma }{(x_{k}-x_{j})}}i\right].}

Referencias

  1. Véase la sección 5.2.1 en Gourieroux, C. y Monfort, A. (1995). Statistics and econometric models, volume 1. Cambridge University Press.
  2. Gouriéroux y Monfort (1995)
  • Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª  ed.). Nueva York: Springer-Verlag. ISBN 0-387-96098-8MR 0804611 . 
  • Freue, Gabriela V. Cohen (2007). "El estimador de Pitman del parámetro de localización de Cauchy". Journal of Statistical Planning and Inference . 137 (6): 1900– 1913. doi : 10.1016/j.jspi.2006.05.002 .
  • Pitman, EJG (1939). "La estimación de los parámetros de localización y escala de una población continua de cualquier forma dada". Biometrika . 30 (3/4): 391– 421. doi : 10.1093/biomet/30.3-4.391 . JSTOR 2332656 . 
  • Pitman, EJG (1939). "Pruebas de hipótesis sobre parámetros de ubicación y escala". Biometrika . 31 (1/2): 200–215 . doi : 10.1093/biomet/31.1-2.200 . JSTOR 2334983 .