Articulo de referencia

El ejemplo de Stein

En la teoría de la decisión y la teoría de la estimación , el ejemplo de Stein (también conocido como fenómeno de Stein o paradoja de Stein ) es la observación de que cuando se ...

En la teoría de la decisión y la teoría de la estimación , el ejemplo de Stein (también conocido como fenómeno de Stein o paradoja de Stein ) es la observación de que cuando se estiman tres o más parámetros simultáneamente, existen estimadores combinados más precisos en promedio (es decir, con un menor error cuadrático medio esperado ) que cualquier método que maneje los parámetros por separado. Recibe su nombre de Charles Stein, de la Universidad de Stanford , quien descubrió el fenómeno en 1955. [ 1 ]

Una explicación intuitiva es que optimizar el error cuadrático medio de un estimador combinado no es lo mismo que optimizar los errores de los estimadores separados de los parámetros individuales. En la práctica, si el error combinado es de interés, entonces se debe usar un estimador combinado, incluso si los parámetros subyacentes son independientes. Si, en cambio, se busca estimar un parámetro individual, entonces usar un estimador combinado no ayuda y, de hecho, resulta contraproducente.

Declaración formal

La siguiente es la forma más simple de la paradoja, el caso especial en el que el número de observaciones es igual al número de parámetros a estimar. Seaθ{\displaystyle {\boldsymbol {\theta }}}sea ​​un vector que consta denorte3{\displaystyle n\geq 3}parámetros desconocidos. Para estimar estos parámetros, se requiere una sola medición.incógnitai{\displaystyle X_{i}}se realiza para cada parámetroθi{\displaystyle \theta _{i}}, lo que resulta en un vectorincógnita{\displaystyle \mathbf {X} }de longitudnorte{\displaystyle n}Supongamos que se sabe que las mediciones son variables aleatorias gaussianas independientes , con mediaθ{\displaystyle {\boldsymbol {\theta }}}y varianza 1, es decir,incógnitanorte(θ,Inorte){\displaystyle \mathbf {X} \sim {\mathcal {N}}({\boldsymbol {\theta }},\mathbf {I} _{n})}Por lo tanto, cada parámetro se estima utilizando una única medición ruidosa, y cada medición es igualmente imprecisa.

En estas condiciones, es intuitivo y común utilizar cada medición como una estimación de su parámetro correspondiente. Esta regla de decisión denominada "ordinaria" se puede escribir comoθ^=incógnita{\displaystyle {\hat {\boldsymbol {\theta }}}=\mathbf {X} }, que es el estimador de máxima verosimilitud (EMV). La calidad de dicho estimador se mide por su función de riesgo . Una función de riesgo comúnmente utilizada es el error cuadrático medio , definido comomi[θθ^2]{\displaystyle \mathbb {E} [\|{\boldsymbol {\theta }}-{\hat {\boldsymbol {\theta }}}\|^{2}]}Sorprendentemente, resulta que la regla de decisión "ordinaria" es subóptima ( inadmisible ) en términos de error cuadrático medio cuandonorte3{\displaystyle n\geq 3}. En otras palabras, en el contexto aquí analizado, existen estimadores alternativos que siempre logran un menor error cuadrático medio, independientemente del valor deθ{\displaystyle {\boldsymbol {\theta }}}es. Para un dadoθ{\displaystyle {\boldsymbol {\theta }}}Obviamente se podría definir un "estimador" perfecto que siempre es simplementeθ{\displaystyle {\boldsymbol {\theta }}}, pero este estimador sería malo para otros valores deθ{\displaystyle {\boldsymbol {\theta }}}.

Los estimadores de la paradoja de Stein son, para un dadoθ{\displaystyle {\boldsymbol {\theta }}}mejor que la regla de decisión "ordinaria"incógnita{\displaystyle \mathbf {X} }para algunosincógnita{\displaystyle \mathbf {X} }pero necesariamente peor para los demás. Solo en promedio son mejores. Más precisamente, un estimadorθ^1{\displaystyle {\sombrero {\boldsymbol {\theta }}}_{1}}Se dice que domina a otro estimador.θ^2{\displaystyle {\sombrero {\boldsymbol {\theta }}}_{2}}si, para todos los valores deθ{\displaystyle {\boldsymbol {\theta }}}, el riesgo deθ^1{\displaystyle {\sombrero {\boldsymbol {\theta }}}_{1}}es menor o igual que el riesgo deθ^2{\displaystyle {\sombrero {\boldsymbol {\theta }}}_{2}}y si la desigualdad es estricta para algúnθ{\displaystyle {\boldsymbol {\theta }}}Se dice que un estimador es admisible si ningún otro estimador lo domina; de lo contrario, es inadmisible . Por lo tanto, el ejemplo de Stein se puede enunciar simplemente de la siguiente manera: La regla de decisión "ordinaria" de la media de una distribución gaussiana multivariada es inadmisible bajo el riesgo de error cuadrático medio.

Muchos estimadores simples y prácticos logran un mejor rendimiento que la regla de decisión "ordinaria". El ejemplo más conocido es el estimador de James-Stein , que reduceincógnita{\displaystyle \mathbf {X} }hacia un punto particular (como el origen) en una cantidad inversamente proporcional a la distancia deincógnita{\displaystyle \mathbf {X} }a partir de ese punto. Para un esbozo de la demostración de este resultado, véase Demostración del ejemplo de Stein . Una demostración alternativa se debe a Larry Brown : demostró que el estimador ordinario para unnorte{\displaystyle n}El vector de media normal multivariante de dimensión es admisible si y solo si elnorte{\displaystyle n}El movimiento browniano de dimensión es recurrente. [ 2 ] Dado que el movimiento browniano no es recurrente paranorte3{\displaystyle n\geq 3}, el MLE no es admisible paranorte3{\displaystyle n\geq 3}.

Una explicación intuitiva

Para cualquier valor particular deθ{\displaystyle {\boldsymbol {\theta }}}El nuevo estimador mejorará al menos uno de los errores cuadráticos medios individuales.mi[(θiθ^i)2].{\displaystyle \mathbb {E} [(\theta _{i}-{\hat {\theta }}_{i})^{2}].}Esto no es difícil, por ejemplo, siθ{\displaystyle {\boldsymbol {\theta }}}está entre −1 y 1, yσ=1{\displaystyle \sigma =1}, entonces un estimador que se contrae linealmenteincógnita{\displaystyle \mathbf {X} }hacia 0 por 0,5 (es decir,firmar(incógnitai)máximo(|incógnitai|0,5,0){\displaystyle \operatorname {sign} (X_{i})\max(|X_{i}|-0.5,0)}, umbralización suave con umbral0,5{\displaystyle 0.5}) tendrá un error cuadrático medio menor queincógnita{\displaystyle \mathbf {X} }en sí mismo. Pero hay otros valores deθ{\displaystyle {\boldsymbol {\theta }}}para los cuales este estimador es peor queincógnita{\displaystyle \mathbf {X} }mismo. El truco del estimador de Stein, y otros que producen la paradoja de Stein, es que ajustan el desplazamiento de tal manera que siempre hay (para cualquierθ{\displaystyle {\boldsymbol {\theta }}}vector) al menos unoincógnitai{\displaystyle X_{i}}cuyo error cuadrático medio se mejora, y su mejora compensa con creces cualquier degradación en el error cuadrático medio que pudiera ocurrir para otroθ^i{\displaystyle {\hat {\theta }}_{i}}El problema es que, sin saberloθ{\displaystyle {\boldsymbol {\theta }}}, no sabes cuál de losnorte{\displaystyle n}Los errores cuadráticos medios mejoran, por lo que no se puede utilizar el estimador de Stein únicamente para esos parámetros.

Un ejemplo de la configuración anterior se da en la estimación de canales en telecomunicaciones, por ejemplo, porque diferentes factores afectan al rendimiento general del canal.

Trascendencia

El ejemplo de Stein resulta sorprendente, ya que la regla de decisión "ordinaria" es intuitiva y de uso común. De hecho, numerosos métodos para la construcción de estimadores, incluyendo la estimación de máxima verosimilitud , la mejor estimación lineal insesgada , la estimación de mínimos cuadrados y la estimación equivariante óptima , dan como resultado el estimador "ordinario". Sin embargo, como se mencionó anteriormente, este estimador es subóptimo.

Ejemplo

Para demostrar lo poco intuitivo del ejemplo de Stein, consideremos el siguiente ejemplo práctico. Supongamos que debemos estimar tres parámetros no relacionados, como el rendimiento del trigo en Estados Unidos en 1993, el número de espectadores en el torneo de tenis de Wimbledon en 2001 y el peso de una barra de chocolate elegida al azar en el supermercado. Supongamos que disponemos de mediciones gaussianas independientes de cada una de estas cantidades. El ejemplo de Stein nos indica que podemos obtener una mejor estimación (en promedio) del vector de tres parámetros utilizando simultáneamente las tres mediciones no relacionadas.

A primera vista, parece que obtenemos un mejor estimador del rendimiento del trigo en EE. UU. midiendo otras estadísticas no relacionadas, como el número de espectadores en Wimbledon y el peso de una chocolatina. Sin embargo, no hemos obtenido un mejor estimador del rendimiento del trigo en EE. UU. por sí solo, sino que hemos generado un estimador para el vector de las medias de las tres variables aleatorias, con un riesgo total reducido . Esto se debe a que el coste de una mala estimación en un componente del vector se compensa con una mejor estimación en otro. Además, un conjunto específico de los tres valores medios estimados obtenidos con el nuevo estimador no será necesariamente mejor que el conjunto habitual (los valores medidos). El nuevo estimador solo es mejor en promedio.

Prueba esquemática

La función de riesgo de una regla de decisiónd(incógnita)=incógnita{\displaystyle d(\mathbf {x} )=\mathbf {x} }es

R(θ,d)=miθ[|θincógnita|2]{\displaystyle R(\theta ,d)=\operatorname {E} _{\theta }[|{\boldsymbol {\theta }}-\mathbf {X} |^{2}]}
=(θincógnita)T(θincógnita)(12π)norte/2mi(1/2)(θincógnita)T(θincógnita)dincógnita{\displaystyle =\int ({\boldsymbol {\theta }}-\mathbf {x} )^{T}({\boldsymbol {\theta }}-\mathbf {x} )\left({\frac {1}{2\pi }}\right)^{n/2}e^{(-1/2)({\boldsymbol {\theta }}-\mathbf {x} )^{T}({\boldsymbol {\theta }}-\mathbf {x} )}dx}
=norte.{\displaystyle =n.}

Ahora consideremos la regla de decisión.

d(incógnita)=incógnitaα|incógnita|2incógnita,{\displaystyle d'(\mathbf {x} )=\mathbf {x} -{\frac {\alpha }{|\mathbf {x} |^{2}}}\mathbf {x} ,}

dóndeα=norte2{\displaystyle \alpha =n-2}Demostraremos qued{\displaystyle d'}es una mejor regla de decisión qued{\displaystyle d}La función de riesgo es

R(θ,d)=miθ[|θincógnita+α|incógnita|2incógnita|2]{\displaystyle R(\theta ,d')=\operatorname {E} _{\theta }\left[\left|\mathbf {\theta -X} +{\frac {\alpha }{|\mathbf {X} |^{2}}}\mathbf {X} \right|^{2}\right]}
=miθ[|θincógnita|2+2(θincógnita)Tα|incógnita|2incógnita+α2|incógnita|4|incógnita|2]{\displaystyle =\operatorname {E} _{\theta }\left[|\mathbf {\theta -X} |^{2}+2(\mathbf {\theta -X} )^{T}{\frac {\alpha }{|\mathbf {X} |^{2}}}\mathbf {X} +{\frac {\alpha ^{2}}{|\mathbf {X} |^{4}}}|\mathbf {X} |^{2}\right]}
=miθ[|θincógnita|2]+2αmiθ[(θincógnita)Tincógnita|incógnita|2]+α2miθ[1|incógnita|2],{\displaystyle =\operatorname {E} _{\theta }\left[|\mathbf {\theta -X} |^{2}\right]+2\alpha \operatorname {E} _{\theta }\left[{\frac {\mathbf {(\theta -X)} ^{T}\mathbf {X} }{|\mathbf {X} |^{2}}}\right]+\alpha ^{2}\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}\right],}

que es cuadrática enα{\displaystyle \alpha }Podemos simplificar el término medio considerando una función general "bien comportada".h:incógnitah(incógnita)R{\displaystyle h:\mathbf {x} \mapsto h(\mathbf {x} )\in \mathbb {R} }y utilizando la integración por partes . Para1inorte{\displaystyle 1\leq i\leq n}, para cualquier continuamente diferenciableh{\displaystyle h}creciendo lo suficientemente lento para grandesincógnitai{\displaystyle x_{i}}tenemos:

miθ[(θiincógnitai)h(incógnita)incógnitaj=incógnitaj(ji)]=(θiincógnitai)h(incógnita)(12π)norte/2mi(1/2)(θincógnita)T(θincógnita)dincógnitai{\displaystyle \operatorname {E} _{\theta }[(\theta _{i}-X_{i})h(\mathbf {X} )\mid X_{j}=x_{j}(j\neq i)]=\int (\theta _{i}-x_{i})h(\mathbf {x} )\left({\frac {1}{2\pi }}\right)^{n/2}e^{-(1/2)({\boldsymbol {\theta }}-\mathbf {x} )^{T}({\boldsymbol {\theta }}-\mathbf {x} )}dx_{i}}
=[h(incógnita)(12π)norte/2mi(1/2)(θincógnita)T(θincógnita)]incógnitai=hincógnitai(incógnita)(12π)norte/2mi(1/2)(θincógnita)T(θincógnita)dincógnitai{\displaystyle =\left[h(\mathbf {x} )\left({\frac {1}{2\pi }}\right)^{n/2}e^{-(1/2)({\boldsymbol {\theta }}-\mathbf {x} )^{T}({\boldsymbol {\theta }}-\mathbf {x} )}\right]_{x_{i}=-\infty }^{\infty }-\int {\frac {\partial h}{\partial x_{i}}}(\mathbf {x} )\left({\frac {1}{2\pi }}\right)^{n/2}e^{-(1/2)({\boldsymbol {\theta }}-\mathbf {x} )^{T}({\boldsymbol {\theta }}-\mathbf {x} )}dx_{i}}
=miθ[hincógnitai(incógnita)incógnitaj=incógnitaj(ji)].{\displaystyle =-\operatorname {E} _{\theta }\left[{\frac {\partial h}{\partial x_{i}}}(\mathbf {X} )\mid X_{j}=x_{j}(j\neq i)\right].}

Por lo tanto,

miθ[(θiincógnitai)h(incógnita)]=miθ[hincógnitai(incógnita)].{\displaystyle \operatorname {E} _{\theta }[(\theta _{i}-X_{i})h(\mathbf {X} )]=-\operatorname {E} _{\theta }\left[{\frac {\partial h}{\partial x_{i}}}(\mathbf {X} )\right].}

(Este resultado se conoce como el lema de Stein ). Ahora, elegimos

h(incógnita)=incógnitai|incógnita|2.{\displaystyle h(\mathbf {x} )={\frac {x_{i}}{|\mathbf {x} |^{2}}}.}

Sih{\displaystyle h}Si cumpliera la condición de "buen comportamiento" (no la cumple, pero esto se puede remediar; véase más abajo), tendríamos

hincógnitai=1|incógnita|22incógnitai2|incógnita|4{\displaystyle {\frac {\partial h}{\partial x_{i}}}={\frac {1}{|\mathbf {x} |^{2}}}-{\frac {2x_{i}^{2}}{|\mathbf {x} |^{4}}}}

y entonces

miθ[(θincógnita)Tincógnita|incógnita|2]=i=1nortemiθ[(θiincógnitai)incógnitai|incógnita|2]{\displaystyle \operatorname {E} _{\theta }\left[{\frac {({\boldsymbol {\theta }}-\mathbf {X} )^{T}\mathbf {X} }{|\mathbf {X} |^{2}}}\right]=\sum _{i=1}^{n}\operatorname {E} _{\theta }\left[(\theta _{i}-X_{i}){\frac {X_{i}}{|\mathbf {X} |^{2}}}\right]}
=i=1nortemiθ[1|incógnita|22incógnitai2|incógnita|4]{\displaystyle =-\sum _{i=1}^{n}\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}-{\frac {2X_{i}^{2}}{|\mathbf {X} |^{4}}}\right]}
=(norte2)miθ[1|incógnita|2].{\displaystyle =-(n-2)\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}\right].}

Luego, volviendo a la función de riesgo ded{\displaystyle d'}:

R(θ,d)=norte2α(norte2)miθ[1|incógnita|2]+α2miθ[1|incógnita|2].{\displaystyle R(\theta ,d')=n-2\alpha (n-2)\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}\right]+\alpha ^{2}\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}\right].}

Esta ecuación cuadrática enα{\displaystyle \alpha }se minimiza enα=norte2{\displaystyle \alpha =n-2}, donación

R(θ,d)=R(θ,d)(norte2)2miθ[1|incógnita|2]{\displaystyle R(\theta ,d')=R(\theta ,d)-(n-2)^{2}\operatorname {E} _{\theta }\left[{\frac {1}{|\mathbf {X} |^{2}}}\right]}

lo cual, por supuesto, satisfaceR(θ,d)<R(θ,d).{\displaystyle R(\theta ,d')<R(\theta ,d).}haciendod{\displaystyle d}una regla de decisión inadmisible.

Queda por justificar el uso de

h(incógnita)=incógnita|incógnita|2.{\displaystyle h(\mathbf {X} )={\frac {\mathbf {X} }{|\mathbf {X} |^{2}}}.}

Esta función no es continuamente diferenciable, ya que es singular enincógnita=0{\displaystyle \mathbf {x} =0}. Sin embargo, la función

h(incógnita)=incógnitaε+|incógnita|2{\displaystyle h(\mathbf {X} )={\frac {\mathbf {X} }{\varepsilon +|\mathbf {X} |^{2}}}}

es continuamente diferenciable, y después de seguir el álgebra y dejarε0{\displaystyle \varepsilon \to 0}Se obtiene el mismo resultado.

Véase también

Notas

  1. Efron, B .; Morris, C. (1977), "La paradoja de Stein en estadística" (PDF) , Scientific American , 236 (5): 119–127 , Bibcode : 1977SciAm.236e.119E , doi : 10.1038/scientificamerican0577-119
  2. Brown, LD (1971). "Estimadores admisibles, difusiones recurrentes y problemas de valores en la frontera insolubles" . The Annals of Mathematical Statistics . 42 (3): 855– 903. doi : 10.1214/aoms/1177693318 . ISSN 0003-4851 . 

Referencias

  • Lehmann, EL ; Casella, G. (1998), "cap. 5", Teoría de la estimación puntual (2.ª  ed.), ISBN 0-471-05849-1
  • Stein, C. (1956). "Inadmisibilidad del estimador usual para la media de una distribución multivariada" . Actas del Tercer Simposio de Berkeley sobre Estadística Matemática y Probabilidad . Vol.  1. págs. 197–206 . MR 0084922 .  
  • Samworth, RJ (2012), "La paradoja de Stein" ( PDF) , Eureka , 62 : 38–41