Articulo de referencia

estimador bayesiano

En la teoría de la estimación y la teoría de la decisión , un estimador bayesiano o una acción bayesiana es un estimador o regla de decisión que minimiza el valor esperado poste...

En la teoría de la estimación y la teoría de la decisión , un estimador bayesiano o una acción bayesiana es un estimador o regla de decisión que minimiza el valor esperado posterior de una función de pérdida (es decir, la pérdida esperada posterior ). De forma equivalente, maximiza la esperanza posterior de una función de utilidad . Una forma alternativa de formular un estimador dentro de la estadística bayesiana es la estimación de máxima probabilidad a posteriori .

Definición

Supongamos que existe un parámetro desconocido.θ{\displaystyle \theta }Se sabe que tiene una distribución previaπ{\displaystyle \pi }. Dejarθ^=θ^(incógnita){\displaystyle {\widehat {\theta }}={\widehat {\theta }}(x)}ser un estimador deθ{\displaystyle \theta } (basado en algunas mediciones x ), y dejemosL(θ,θ^){\displaystyle L(\theta ,{\widehat {\theta }})}ser una función de pérdida , como el error cuadrático. El riesgo de Bayes deθ^{\displaystyle {\widehat {\theta }}}se define comomiπ(L(θ,θ^)){\displaystyle E_{\pi }(L(\theta ,{\widehat {\theta }}))}, donde la esperanza se toma sobre la distribución de probabilidad deθ{\displaystyle \theta }: esto define la función de riesgo como una función deθ^{\displaystyle {\widehat {\theta }}}Un estimadorθ^{\displaystyle {\widehat {\theta }}}Se dice que es un estimador bayesiano si minimiza el riesgo bayesiano entre todos los estimadores. De forma equivalente, el estimador que minimiza la pérdida esperada posteriormi(L(θ,θ^)|incógnita){\displaystyle E(L(\theta ,{\widehat {\theta }})|x)}para cadaincógnita{\displaystyle x}También minimiza el riesgo de Bayes y, por lo tanto, es un estimador de Bayes. [ 1 ]

Si la distribución a priori es impropia, entonces un estimador que minimice la pérdida esperada posterior para cadaincógnita{\displaystyle x}se denomina estimador bayesiano generalizado . [ 2 ]

Ejemplos

Estimación del error cuadrático medio mínimo

La función de riesgo más común utilizada para la estimación bayesiana es el error cuadrático medio (ECM), también llamado riesgo de error cuadrático . El ECM se define por

METROSmi=mi[(θ^(incógnita)θ)2],{\displaystyle \mathrm {MSE} =E\left[({\widehat {\theta }}(x)-\theta )^{2}\right],}

donde la esperanza se toma sobre la distribución conjunta deθ{\displaystyle \theta }yincógnita{\displaystyle x}.

Media posterior

Utilizando el MSE como riesgo, la estimación bayesiana del parámetro desconocido es simplemente la media de la distribución posterior , [ 3 ]

θ^(incógnita)=mi[θ|incógnita]=θpag(θ|incógnita)dθ.{\displaystyle {\widehat {\theta }}(x)=E[\theta |x]=\int \theta \,p(\theta |x)\,d\theta .}

Esto se conoce como el estimador de mínimo error cuadrático medio (MMSE, por sus siglas en inglés).

Estimadores bayesianos para distribuciones a priori conjugadas

Si no existe una razón intrínseca para preferir una distribución de probabilidad a priori sobre otra, a veces se elige una distribución a priori conjugada por simplicidad. Una distribución a priori conjugada se define como una distribución a priori perteneciente a una familia paramétrica , cuya distribución a posteriori resultante también pertenece a la misma familia. Esta es una propiedad importante, ya que el estimador bayesiano, así como sus propiedades estadísticas (varianza, intervalo de confianza, etc.), pueden derivarse de la distribución a posteriori.

Las distribuciones a priori conjugadas son especialmente útiles para la estimación secuencial, donde la distribución a posteriori de la medición actual se utiliza como distribución a priori en la siguiente medición. En la estimación secuencial, a menos que se utilice una distribución a priori conjugada, la distribución a posteriori suele volverse más compleja con cada medición añadida, y el estimador bayesiano generalmente no se puede calcular sin recurrir a métodos numéricos.

A continuación se presentan algunos ejemplos de distribuciones a priori conjugadas.

  • Siincógnita|θ{\displaystyle x|\theta }es normal ,incógnita|θnorte(θ,σ2){\displaystyle x|\theta \sim N(\theta ,\sigma ^{2})}y la distribución a priori es normal,θnorte(μ,τ2){\displaystyle \theta \sim N(\mu ,\tau ^{2})}, entonces la distribución posterior también es normal y el estimador bayesiano bajo MSE viene dado por
θ^(incógnita)=σ2σ2+τ2μ+τ2σ2+τ2incógnita.{\displaystyle {\widehat {\theta }}(x)={\frac {\sigma ^{2}}{\sigma ^{2}+\tau ^{2}}}\mu +{\frac {\tau ^{2}}{\sigma ^{2}+\tau ^{2}}}x.}
  • Siincógnita1,...,incógnitanorte{\displaystyle x_{1},...,x_{n}}son variables aleatorias de Poisson i.i.d.incógnitai|θPAG(θ){\displaystyle x_{i}|\theta \sim P(\theta )}y si la distribución a priori es GammaθGRAMO(a,b){\displaystyle \theta \sim G(a,b)}, entonces la distribución posterior también es Gamma, y ​​el estimador bayesiano bajo MSE viene dado por
θ^(incógnita)=norteincógnita¯+anorte+b.{\displaystyle {\widehat {\theta }}(X)={\frac {n{\overline {X}}+a}{n+b}}.}
  • Siincógnita1,...,incógnitanorte{\displaystyle x_{1},...,x_{n}}son i.i.d. distribuidas uniformementeincógnitai|θU(0,θ){\displaystyle x_{i}|\theta \sim U(0,\theta )}y si la distribución a priori es de ParetoθPAGa(θ0,a){\displaystyle \theta \sim Pa(\theta _{0},a)}, entonces la distribución posterior también es de Pareto, y el estimador bayesiano bajo MSE viene dado por
θ^(incógnita)=(a+norte)máximo(θ0,incógnita1,...,incógnitanorte)a+norte1.{\displaystyle {\widehat {\theta }}(X)={\frac {(a+n)\max {(\theta _{0},x_{1},...,x_{n})}}{a+n-1}}.}

Funciones de riesgo alternativas

Las funciones de riesgo se eligen en función de cómo se mide la distancia entre la estimación y el parámetro desconocido. El MSE es la función de riesgo más común, principalmente debido a su simplicidad. Sin embargo, ocasionalmente también se utilizan funciones de riesgo alternativas. A continuación se presentan varios ejemplos de dichas alternativas. Denotamos la función de distribución generalizada posterior porF{\displaystyle F}.

Mediana posterior y otros cuantiles

Una función de pérdida "lineal", cona>0{\displaystyle a>0}, lo que produce la mediana posterior como estimación bayesiana:

L(θ,θ^)=a|θθ^|{\displaystyle L(\theta ,{\widehat {\theta }})=a|\theta -{\widehat {\theta }}|}
F(θ^(incógnita)|incógnita)=12.{\displaystyle F({\widehat {\theta }}(x)|X)={\tfrac {1}{2}}.}

Otra función de pérdida "lineal", que asigna diferentes "pesos".a,b>0{\displaystyle a,b>0}a la sobreestimación o subestimación. Produce un cuantil de la distribución posterior y es una generalización de la función de pérdida anterior:

L(θ,θ^)={a|θθ^|,para θθ^0b|θθ^|,para θθ^<0{\displaystyle L(\theta ,{\widehat {\theta }})={\begin{cases}a|\theta -{\widehat {\theta }}|,&{\mbox{para }}\theta -{\widehat {\theta }}\geq 0\\b|\theta -{\widehat {\theta }}|,&{\mbox{para }}\theta -{\widehat {\theta }}<0\end{cases}}}
F(θ^(incógnita)|incógnita)=aa+b.{\displaystyle F({\widehat {\theta }}(x)|X)={\frac {a}{a+b}}.}

Modo posterior

La siguiente función de pérdida produce el modo posterior en el límite deK>0{\displaystyle K>0}, bajo ciertas condiciones en la posterior [ 4 ] :

L(θ,θ^)={0,para |θθ^|<KL,para |θθ^|K,{\displaystyle L(\theta ,{\widehat {\theta }})={\begin{cases}0,&{\mbox{para }}|\theta -{\widehat {\theta }}|<K\\L,&{\mbox{para }}|\theta -{\widehat {\theta }}|\geq K,\end{cases}}}

dóndeL>0{\displaystyle L>0}es una constante.

Estimadores Lp

También se puede considerarLPAG{\displaystyle L^{P}}riesgo para el cual la pérdida está dada por

L(θ,θ^)=|θθ^|pag,pag>0.{\displaystyle L(\theta ,{\hat {\theta }})=|\theta -{\hat {\theta }}|^{p},\,p>0.}

Si bien es óptimoLpag{\displaystyle L^{p}}Los estimadores pueden ser difíciles de caracterizar en forma cerrada, pero comparten muchas propiedades similares a las de los demás.L2{\displaystyle L^{2}}caso. [ 5 ]

Se pueden concebir otras funciones de pérdida, aunque el error cuadrático medio es la más utilizada y validada. Otras funciones de pérdida se utilizan en estadística, particularmente en estadística robusta .

Estimadores bayesianos generalizados

La distribución previapag{\displaystyle p}Hasta ahora se ha asumido que es una verdadera distribución de probabilidad, en el sentido de que

pag(θ)dθ=1.{\displaystyle \int p(\theta )d\theta =1.}

Sin embargo, en ocasiones esto puede ser un requisito restrictivo. Por ejemplo, no existe una distribución (que cubra el conjunto R de todos los números reales) para la cual cada número real sea igualmente probable. Sin embargo, en cierto sentido, tal "distribución" parece una elección natural para una distribución a priori no informativa , es decir, una distribución a priori que no implica una preferencia por ningún valor particular del parámetro desconocido. Aún se puede definir una función.pag(θ)=1{\displaystyle p(\theta )=1}, pero esta no sería una distribución de probabilidad adecuada ya que tiene masa infinita,

pag(θ)dθ=.{\displaystyle \int {p(\theta )d\theta }=\infty .}

Tales medidaspag(θ){\displaystyle p(\theta )}Las que no son distribuciones de probabilidad se denominan distribuciones a priori impropias .

El uso de una distribución a priori impropia implica que el riesgo bayesiano no está definido (ya que la distribución a priori no es una distribución de probabilidad y no podemos calcular una esperanza bajo ella). En consecuencia, ya no tiene sentido hablar de un estimador bayesiano que minimice el riesgo bayesiano. Sin embargo, en muchos casos, se puede definir la distribución a posteriori.

pag(θ|incógnita)=pag(incógnita|θ)pag(θ)pag(incógnita|θ)pag(θ)dθ.{\displaystyle p(\theta |x)={\frac {p(x|\theta )p(\theta )}{\int p(x|\theta )p(\theta )d\theta }}.}

Esta es una definición, y no una aplicación del teorema de Bayes , ya que el teorema de Bayes solo se puede aplicar cuando todas las distribuciones son propias. Sin embargo, no es raro que la "posterior" resultante sea una distribución de probabilidad válida. En este caso, la pérdida esperada posterior

L(θ,a)pag(θ|incógnita)dθ{\displaystyle \int {L(\theta ,a)p(\theta |x)d\theta }}

Por lo general, está bien definido y es finito. Recordemos que, para una distribución a priori adecuada, el estimador bayesiano minimiza la pérdida esperada a posteriori. Cuando la distribución a priori es inadecuada, un estimador que minimiza la pérdida esperada a posteriori se denomina estimador bayesiano generalizado . [ 2 ]

Ejemplo

Un ejemplo típico es la estimación de un parámetro de localización con una función de pérdida del tipoL(aθ){\displaystyle L(a-\theta )}. Aquíθ{\displaystyle \theta }es un parámetro de ubicación, es decir,pag(incógnita|θ)=F(incógnitaθ){\displaystyle p(x|\theta )=f(x-\theta )}.

Es común utilizar el uso incorrecto previopag(θ)=1{\displaystyle p(\theta )=1}en este caso, especialmente cuando no se dispone de otra información más subjetiva. Esto produce

pag(θ|incógnita)=pag(incógnita|θ)pag(θ)pag(incógnita)=F(incógnitaθ)pag(incógnita){\displaystyle p(\theta |x)={\frac {p(x|\theta )p(\theta )}{p(x)}}={\frac {f(x-\theta )}{p(x)}}}

por lo tanto la pérdida esperada posterior

mi[L(aθ)|incógnita]=L(aθ)pag(θ|incógnita)dθ=1pag(incógnita)L(aθ)F(incógnitaθ)dθ.{\displaystyle E[L(a-\theta )|x]=\int {L(a-\theta )p(\theta |x)d\theta }={\frac {1}{p(x)}}\int L(a-\theta )f(x-\theta )d\theta .}

El estimador bayesiano generalizado es el valora(incógnita){\displaystyle a(x)}que minimiza esta expresión para un dadoincógnita{\displaystyle x}Esto equivale a minimizar

L(aθ)F(incógnitaθ)dθ{\displaystyle \int L(a-\theta )f(x-\theta )d\theta }para un dadoincógnita.{\displaystyle x.}    (1)

En este caso se puede demostrar que el estimador bayesiano generalizado tiene la formaincógnita+a0{\displaystyle x+a_{0}}, por alguna constantea0{\displaystyle a_{0}}Para ver esto, dejaa0{\displaystyle a_{0}}sea ​​el valor que minimiza (1) cuandoincógnita=0{\displaystyle x=0}. Luego, dado un valor diferenteincógnita1{\displaystyle x_{1}}debemos minimizar

L(aθ)F(incógnita1θ)dθ=L(aincógnita1θ)F(θ)dθ.{\displaystyle \int L(a-\theta )f(x_{1}-\theta )d\theta =\int L(a-x_{1}-\theta ')f(-\theta ')d\theta '.}    (2)

Esto es idéntico a (1), excepto quea{\displaystyle a}ha sido reemplazado poraincógnita1{\displaystyle a-x_{1}}Por lo tanto, la expresión que minimiza viene dada poraincógnita1=a0{\displaystyle a-x_{1}=a_{0}}, de modo que el estimador óptimo tenga la forma

a(incógnita)=a0+incógnita.{\displaystyle a(x)=a_{0}+x.\,\!}

Estimadores bayesianos empíricos

Un estimador bayesiano derivado mediante el método bayesiano empírico se denomina estimador bayesiano empírico . Los métodos bayesianos empíricos permiten el uso de datos empíricos auxiliares, procedentes de observaciones de parámetros relacionados, para el desarrollo de un estimador bayesiano. Esto se realiza bajo el supuesto de que los parámetros estimados se obtienen a partir de una distribución a priori común. Por ejemplo, si se realizan observaciones independientes de diferentes parámetros, el rendimiento de la estimación de un parámetro en particular puede mejorarse utilizando datos de otras observaciones.

Existen enfoques tanto paramétricos como no paramétricos para la estimación empírica bayesiana. [ 6 ]

Ejemplo

El siguiente es un ejemplo simple de estimación bayesiana empírica paramétrica. Dadas las observaciones pasadasincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}tener distribución condicionalF(incógnitai|θi){\displaystyle f(x_{i}|\theta _{i})}, uno está interesado en estimarθnorte+1{\displaystyle \theta _{n+1}}Residencia enincógnitanorte+1{\displaystyle x_{n+1}}. Supongamos que elθi{\displaystyle \theta _{i}}tienen un antecedente comúnπ{\displaystyle \pi }que depende de parámetros desconocidos. Por ejemplo, supongamos queπ{\displaystyle \pi }es normal con media desconocidaμπ{\displaystyle \mu _{\pi }\,\!}y varianzaσπ.{\displaystyle \sigma _{\pi }\,\!.}Luego podemos usar las observaciones pasadas para determinar la media y la varianza deπ{\displaystyle \pi }de la siguiente manera.

Primero, estimamos la mediaμmetro{\displaystyle \mu _{m}\,\!}y varianzaσmetro{\displaystyle \sigma _{m}\,\!}de la distribución marginal deincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}utilizando el método de máxima verosimilitud :

μ^metro=1norteincógnitai,{\displaystyle {\widehat {\mu }}_{m}={\frac {1}{n}}\sum {x_{i}},}
σ^metro2=1norte(incógnitaiμ^metro)2.{\displaystyle {\widehat {\sigma }}_{m}^{2}={\frac {1}{n}}\sum {(x_{i}-{\widehat {\mu }}_{m})^{2}}.}

A continuación, utilizamos la ley de la esperanza total para calcularμmetro{\displaystyle \mu _{m}}y la ley de la varianza total para calcularσmetro2{\displaystyle \sigma _{m}^{2}}de tal manera que

μmetro=miπ[μF(θ)],{\displaystyle \mu _{m}=E_{\pi }[\mu _{f}(\theta )]\,\!,}
σmetro2=miπ[σF2(θ)]+miπ[(μF(θ)μmetro)2],{\displaystyle \sigma _{m}^{2}=E_{\pi }[\sigma _{f}^{2}(\theta )]+E_{\pi }[(\mu _{f}(\theta )-\mu _{m})^{2}],}

dóndeμF(θ){\displaystyle \mu _{f}(\theta )}yσF(θ){\displaystyle \sigma _{f}(\theta )}son los momentos de la distribución condicionalF(incógnitai|θi){\displaystyle f(x_{i}|\theta _{i})}, que se suponen conocidos. En particular, supongamos queμF(θ)=θ{\displaystyle \mu _{f}(\theta )=\theta }y esoσF2(θ)=K{\displaystyle \sigma _{f}^{2}(\theta )=K}; entonces tenemos

μπ=μmetro,{\displaystyle \mu _{\pi }=\mu _{m}\,\!,}
σπ2=σmetro2σF2=σmetro2K.{\displaystyle \sigma _{\pi }^{2}=\sigma _{m}^{2}-\sigma _{f}^{2}=\sigma _{m}^{2}-K.}

Finalmente, obtenemos los momentos estimados de la distribución a priori,

μ^π=μ^metro,{\displaystyle {\widehat {\mu }}_{\pi }={\widehat {\mu }}_{m},}
σ^π2=σ^metro2K.{\displaystyle {\widehat {\sigma }}_{\pi }^{2}={\widehat {\sigma }}_{m}^{2}-K.}

Por ejemplo, siincógnitai|θinorte(θi,1){\displaystyle x_{i}|\theta _{i}\sim N(\theta _{i},1)}y si asumimos una distribución a priori normal (que en este caso es una distribución a priori conjugada), concluimos queθnorte+1norte(μ^π,σ^π2){\displaystyle \theta _{n+1}\sim N({\widehat {\mu }}_{\pi },{\widehat {\sigma }}_{\pi }^{2})}, a partir del cual el estimador bayesiano deθnorte+1{\displaystyle \theta _{n+1}}Residencia enincógnitanorte+1{\displaystyle x_{n+1}}se puede calcular.

Propiedades

Admisibilidad

Las reglas bayesianas con riesgo bayesiano finito suelen ser admisibles . A continuación se presentan algunos ejemplos específicos de teoremas de admisibilidad.

  • Si una regla de Bayes es única, entonces es admisible. [ 7 ] Por ejemplo, como se indicó anteriormente, bajo el error cuadrático medio (ECM), la regla de Bayes es única y, por lo tanto, admisible.
  • Si θ pertenece a un conjunto discreto , entonces todas las reglas de Bayes son admisibles.
  • Si θ pertenece a un conjunto continuo (no discreto) y si la función de riesgo R(θ,δ) es continua en θ para cada δ, entonces todas las reglas de Bayes son admisibles.

Por el contrario, las reglas bayesianas generalizadas a menudo tienen un riesgo bayesiano indefinido en el caso de distribuciones previas impropias. Estas reglas suelen ser inadmisibles y la verificación de su admisibilidad puede ser difícil. Por ejemplo, el estimador bayesiano generalizado de un parámetro de localización θ basado en muestras gaussianas (descrito en la sección "Estimador bayesiano generalizado" anterior) es inadmisible parapag>2{\displaystyle p>2}; esto se conoce como el fenómeno de Stein .

Eficiencia asintótica

Sea θ una variable aleatoria desconocida, y supongamos queincógnita1,incógnita2,{\displaystyle x_{1},x_{2},\ldots }son muestras iid con densidadF(incógnitai|θ){\displaystyle f(x_{i}|\theta )}. Dejarδnorte=δnorte(incógnita1,,incógnitanorte){\displaystyle \delta _{n}=\delta _{n}(x_{1},\ldots ,x_{n})}sea ​​una secuencia de estimadores bayesianos de θ basados ​​en un número creciente de mediciones. Estamos interesados ​​en analizar el desempeño asintótico de esta secuencia de estimadores, es decir, el desempeño deδnorte{\displaystyle \delta _{n}}para n grande .

Para ello, es habitual considerar a θ como un parámetro determinista cuyo verdadero valor esθ0{\displaystyle \theta _{0}}. Bajo ciertas condiciones, [ 8 ] para muestras grandes (valores grandes de n ), la densidad posterior de θ es aproximadamente normal. En otras palabras, para n grande , el efecto de la probabilidad previa sobre la posterior es insignificante. Además, si δ es el estimador bayesiano bajo riesgo de MSE, entonces es asintóticamente insesgado y converge en distribución a la distribución normal :

norte(δnorteθ0)norte(0,1I(θ0)),{\displaystyle {\sqrt {n}}(\delta _{n}-\theta _{0})\to N\left(0,{\frac {1}{I(\theta _{0})}}\right),}

donde I0 ) es la información de Fisher de θ 0 . De ello se deduce que el estimador bayesiano δ n bajo MSE es asintóticamente eficiente .

Otro estimador asintóticamente normal y eficiente es el estimador de máxima verosimilitud (EMV). La relación entre los estimadores de máxima verosimilitud y bayesianos se puede ilustrar con el siguiente ejemplo sencillo.

Ejemplo: estimación de p en una distribución binomial

Consideremos el estimador de θ basado en una muestra binomial x ~b(θ, n ), donde θ denota la probabilidad de éxito. Suponiendo que θ se distribuye según la distribución a priori conjugada, que en este caso es la distribución Beta B( a , b ), se sabe que la distribución a posteriori es B(a+x,b+nx). Por lo tanto, el estimador bayesiano bajo el error cuadrático medio es

δnorte(incógnita)=mi[θ|incógnita]=a+incógnitaa+b+norte.{\displaystyle \delta _{n}(x)=E[\theta |x]={\frac {a+x}{a+b+n}}.}

El MLE en este caso es x/n y por lo tanto obtenemos,

δnorte(incógnita)=a+ba+b+nortemi[θ]+nortea+b+norteδMETROLmi.{\displaystyle \delta _{n}(x)={\frac {a+b}{a+b+n}}E[\theta ]+{\frac {n}{a+b+n}}\delta _{MLE}.}

La última ecuación implica que, para n → ∞, el estimador bayesiano (en el problema descrito) está cerca del MLE.

Por otro lado, cuando n es pequeño, la información previa sigue siendo relevante para el problema de decisión y afecta la estimación. Para ver el peso relativo de la información previa, supongamos que a = b ; en este caso, cada medición aporta 1 bit nuevo de información; la fórmula anterior muestra que la información previa tiene el mismo peso que a+b bits de la nueva información. En las aplicaciones, a menudo se sabe muy poco sobre los detalles de la distribución previa; en particular, no hay razón para suponer que coincide exactamente con B( a , b ). En tal caso, una posible interpretación de este cálculo es: "existe una distribución previa no patológica con un valor medio de 0,5 y una desviación estándar d que da como resultado un peso de la información previa igual a 1/(4d² ) -1 bits de nueva información".

Otro ejemplo del mismo fenómeno es el caso en que la estimación previa y una medición tienen una distribución normal. Si la estimación previa está centrada en B con desviación Σ, y la medición está centrada en b con desviación σ, entonces la estimación posterior está centrada enαα+βB+βα+βb{\displaystyle {\frac {\alpha }{\alpha +\beta }}B+{\frac {\beta }{\alpha +\beta }}b}En este promedio ponderado, los pesos son α=σ² y β=Σ². Además, la desviación posterior al cuadrado es Σ²+σ². En otras palabras, la distribución a priori se combina con la medición exactamente igual que si se tratara de una medición adicional a tener en cuenta.

Por ejemplo, si Σ=σ/2, entonces la desviación de 4 mediciones combinadas coincide con la desviación de la distribución a priori (suponiendo que los errores de medición son independientes). Y los pesos α,β en la fórmula para la distribución a posteriori coinciden con esto: el peso de la distribución a priori es 4 veces el peso de la medición. Al combinar esta distribución a priori con n mediciones con un promedio v, se obtiene la distribución a posteriori centrada en44+norteV+norte4+nortev{\displaystyle {\frac {4}{4+n}}V+{\frac {n}{4+n}}v}En particular, la distribución a priori desempeña el mismo papel que cuatro mediciones realizadas previamente. En general, la distribución a priori tiene un peso de (σ/Σ)² mediciones.

Compárese con el ejemplo de la distribución binomial: allí, la distribución a priori tiene un peso de (σ/Σ)²−1 mediciones. Se puede observar que el peso exacto depende de los detalles de la distribución, pero cuando σ≫Σ, la diferencia se vuelve pequeña.

Ejemplo práctico de estimadores bayesianos

La base de datos de películas de Internet (IMDb) utiliza una fórmula para calcular y comparar las calificaciones de las películas por parte de sus usuarios, incluyendo sus 250 títulos mejor calificados, la cual, según afirman, proporciona "una verdadera estimación bayesiana". [ 9 ] La siguiente fórmula bayesiana se utilizó inicialmente para calcular una puntuación promedio ponderada para los 250 títulos mejor calificados, aunque la fórmula ha cambiado desde entonces:

W=Rv+dometrov+metro {\displaystyle W={Rv+Cm \over v+m}\ }

dónde:

W {\displaystyle W\ }= calificación ponderada
R {\displaystyle R\ }= calificación promedio de la película como un número del 1 al 10 (media) = (Calificación)
v {\displaystyle v\ }= número de votos/calificaciones para la película = (votos)
metro {\displaystyle m\ }= peso asignado a la estimación previa (en este caso, el número de votos que IMDB consideró necesarios para que la calificación promedio se aproximara a la validez estadística)
do {\displaystyle C\ }= el voto medio en todo el grupo (actualmente 7,0)

Nótese que W es simplemente la media aritmética ponderada de R y C con vector de ponderación (v, m) . A medida que el número de calificaciones supera m , la confianza de la calificación promedio supera la confianza del voto promedio para todas las películas (C), y la calificación bayesiana ponderada (W) se aproxima a un promedio simple (R). Cuanto más cerca de cero esté v (el número de calificaciones para la película), más cerca estará W de C , donde W es la calificación ponderada y C es la calificación promedio de todas las películas. Por lo tanto, en términos más simples, cuantas menos calificaciones/votos se emitan para una película, más sesgará su calificación ponderada hacia el promedio de todas las películas, mientras que las películas con muchas calificaciones/votos tendrán una calificación que se aproxime a su calificación promedio aritmética pura.

El método de IMDb garantiza que una película con solo unas pocas calificaciones, todas de 10, no se sitúe por encima de "El Padrino", por ejemplo, que tiene una media de 9,2 basada en más de 500.000 valoraciones.

Véase también

Notas

  1. Lehmann y Casella, Teorema 4.1.1
  2. 1 2 Lehmann y Casella, Definición 4.2.9
  3. Jaynes, ET (2007). Teoría de la probabilidad: La lógica de la ciencia ( 5.ª  ed. impresa). Cambridge [ua]: Cambridge Univ. Press. p. 172. ISBN  978-0-521-59271-0.
  4. Bassett, Robert; Deride, Julio (marzo de 2019). "Estimadores a posteriori máximos como límite de los estimadores bayesianos". Mathematical Programming . 174 ( 1–2 ): 129–144 . arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 .
  5. Dytso, A.; Bustin, R.; Tuninetti, D.; Devroye, N.; Poor, HV; Shamai Shitz, S. (2018). "Sobre el mínimo error medio pth en canales de ruido gaussiano y sus aplicaciones". IEEE Transactions on Information Theory . 64 (3). IEEE : 2012–2037 . arXiv : 1607.01461 . doi : 10.1109/TIT.2017.2782786 .
  6. Berger (1980), sección 4.5.
  7. Lehmann y Casella (1998), Teorema 5.2.4.
  8. Lehmann y Casella (1998), sección 6.8
  9. "IMDb Top 250" . Archivado del original el 1 de junio de 2012.

Referencias

  • Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª  ed.). Nueva York: Springer-Verlag. ISBN 0-387-96098-8MR 0804611 . 
  • Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2.ª  ed.). Springer. ISBN 0-387-98502-6.
  • Pilz, Jürgen (1991). «Estimación bayesiana». Estimación bayesiana y diseño experimental en modelos de regresión lineal . Chichester: John Wiley & Sons. pp. 38–117 . ISBN  0-471-91732-X.