En la teoría de la estimación y la teoría de la decisión , un estimador bayesiano o una acción bayesiana es un estimador o regla de decisión que minimiza el valor esperado posterior de una función de pérdida (es decir, la pérdida esperada posterior ). De forma equivalente, maximiza la esperanza posterior de una función de utilidad . Una forma alternativa de formular un estimador dentro de la estadística bayesiana es la estimación de máxima probabilidad a posteriori .
Definición
Supongamos que existe un parámetro desconocido.Se sabe que tiene una distribución previa. Dejarser un estimador de (basado en algunas mediciones x ), y dejemosser una función de pérdida , como el error cuadrático. El riesgo de Bayes dese define como, donde la esperanza se toma sobre la distribución de probabilidad de: esto define la función de riesgo como una función deUn estimadorSe dice que es un estimador bayesiano si minimiza el riesgo bayesiano entre todos los estimadores. De forma equivalente, el estimador que minimiza la pérdida esperada posteriorpara cadaTambién minimiza el riesgo de Bayes y, por lo tanto, es un estimador de Bayes. [ 1 ]
Si la distribución a priori es impropia, entonces un estimador que minimice la pérdida esperada posterior para cadase denomina estimador bayesiano generalizado . [ 2 ]
Ejemplos
Estimación del error cuadrático medio mínimo
La función de riesgo más común utilizada para la estimación bayesiana es el error cuadrático medio (ECM), también llamado riesgo de error cuadrático . El ECM se define por
donde la esperanza se toma sobre la distribución conjunta dey.
Media posterior
Utilizando el MSE como riesgo, la estimación bayesiana del parámetro desconocido es simplemente la media de la distribución posterior , [ 3 ]
Esto se conoce como el estimador de mínimo error cuadrático medio (MMSE, por sus siglas en inglés).
Estimadores bayesianos para distribuciones a priori conjugadas
Si no existe una razón intrínseca para preferir una distribución de probabilidad a priori sobre otra, a veces se elige una distribución a priori conjugada por simplicidad. Una distribución a priori conjugada se define como una distribución a priori perteneciente a una familia paramétrica , cuya distribución a posteriori resultante también pertenece a la misma familia. Esta es una propiedad importante, ya que el estimador bayesiano, así como sus propiedades estadísticas (varianza, intervalo de confianza, etc.), pueden derivarse de la distribución a posteriori.
Las distribuciones a priori conjugadas son especialmente útiles para la estimación secuencial, donde la distribución a posteriori de la medición actual se utiliza como distribución a priori en la siguiente medición. En la estimación secuencial, a menos que se utilice una distribución a priori conjugada, la distribución a posteriori suele volverse más compleja con cada medición añadida, y el estimador bayesiano generalmente no se puede calcular sin recurrir a métodos numéricos.
A continuación se presentan algunos ejemplos de distribuciones a priori conjugadas.
- Sies normal ,y la distribución a priori es normal,, entonces la distribución posterior también es normal y el estimador bayesiano bajo MSE viene dado por
- Sison variables aleatorias de Poisson i.i.d.y si la distribución a priori es Gamma, entonces la distribución posterior también es Gamma, y el estimador bayesiano bajo MSE viene dado por
- Sison i.i.d. distribuidas uniformementey si la distribución a priori es de Pareto, entonces la distribución posterior también es de Pareto, y el estimador bayesiano bajo MSE viene dado por
Funciones de riesgo alternativas
Las funciones de riesgo se eligen en función de cómo se mide la distancia entre la estimación y el parámetro desconocido. El MSE es la función de riesgo más común, principalmente debido a su simplicidad. Sin embargo, ocasionalmente también se utilizan funciones de riesgo alternativas. A continuación se presentan varios ejemplos de dichas alternativas. Denotamos la función de distribución generalizada posterior por.
Mediana posterior y otros cuantiles
Una función de pérdida "lineal", con, lo que produce la mediana posterior como estimación bayesiana:
Otra función de pérdida "lineal", que asigna diferentes "pesos".a la sobreestimación o subestimación. Produce un cuantil de la distribución posterior y es una generalización de la función de pérdida anterior:
Modo posterior
La siguiente función de pérdida produce el modo posterior en el límite de, bajo ciertas condiciones en la posterior [ 4 ] :
dóndees una constante.
Estimadores Lp
También se puede considerarriesgo para el cual la pérdida está dada por
Si bien es óptimoLos estimadores pueden ser difíciles de caracterizar en forma cerrada, pero comparten muchas propiedades similares a las de los demás.caso. [ 5 ]
Se pueden concebir otras funciones de pérdida, aunque el error cuadrático medio es la más utilizada y validada. Otras funciones de pérdida se utilizan en estadística, particularmente en estadística robusta .
Estimadores bayesianos generalizados
La distribución previaHasta ahora se ha asumido que es una verdadera distribución de probabilidad, en el sentido de que
Sin embargo, en ocasiones esto puede ser un requisito restrictivo. Por ejemplo, no existe una distribución (que cubra el conjunto R de todos los números reales) para la cual cada número real sea igualmente probable. Sin embargo, en cierto sentido, tal "distribución" parece una elección natural para una distribución a priori no informativa , es decir, una distribución a priori que no implica una preferencia por ningún valor particular del parámetro desconocido. Aún se puede definir una función., pero esta no sería una distribución de probabilidad adecuada ya que tiene masa infinita,
Tales medidasLas que no son distribuciones de probabilidad se denominan distribuciones a priori impropias .
El uso de una distribución a priori impropia implica que el riesgo bayesiano no está definido (ya que la distribución a priori no es una distribución de probabilidad y no podemos calcular una esperanza bajo ella). En consecuencia, ya no tiene sentido hablar de un estimador bayesiano que minimice el riesgo bayesiano. Sin embargo, en muchos casos, se puede definir la distribución a posteriori.
Esta es una definición, y no una aplicación del teorema de Bayes , ya que el teorema de Bayes solo se puede aplicar cuando todas las distribuciones son propias. Sin embargo, no es raro que la "posterior" resultante sea una distribución de probabilidad válida. En este caso, la pérdida esperada posterior
Por lo general, está bien definido y es finito. Recordemos que, para una distribución a priori adecuada, el estimador bayesiano minimiza la pérdida esperada a posteriori. Cuando la distribución a priori es inadecuada, un estimador que minimiza la pérdida esperada a posteriori se denomina estimador bayesiano generalizado . [ 2 ]
Ejemplo
Un ejemplo típico es la estimación de un parámetro de localización con una función de pérdida del tipo. Aquíes un parámetro de ubicación, es decir,.
Es común utilizar el uso incorrecto previoen este caso, especialmente cuando no se dispone de otra información más subjetiva. Esto produce
por lo tanto la pérdida esperada posterior
El estimador bayesiano generalizado es el valorque minimiza esta expresión para un dadoEsto equivale a minimizar
- para un dado (1)
En este caso se puede demostrar que el estimador bayesiano generalizado tiene la forma, por alguna constantePara ver esto, dejasea el valor que minimiza (1) cuando. Luego, dado un valor diferentedebemos minimizar
- (2)
Esto es idéntico a (1), excepto queha sido reemplazado porPor lo tanto, la expresión que minimiza viene dada por, de modo que el estimador óptimo tenga la forma
Estimadores bayesianos empíricos
Un estimador bayesiano derivado mediante el método bayesiano empírico se denomina estimador bayesiano empírico . Los métodos bayesianos empíricos permiten el uso de datos empíricos auxiliares, procedentes de observaciones de parámetros relacionados, para el desarrollo de un estimador bayesiano. Esto se realiza bajo el supuesto de que los parámetros estimados se obtienen a partir de una distribución a priori común. Por ejemplo, si se realizan observaciones independientes de diferentes parámetros, el rendimiento de la estimación de un parámetro en particular puede mejorarse utilizando datos de otras observaciones.
Existen enfoques tanto paramétricos como no paramétricos para la estimación empírica bayesiana. [ 6 ]
Ejemplo
El siguiente es un ejemplo simple de estimación bayesiana empírica paramétrica. Dadas las observaciones pasadastener distribución condicional, uno está interesado en estimarResidencia en. Supongamos que eltienen un antecedente comúnque depende de parámetros desconocidos. Por ejemplo, supongamos quees normal con media desconociday varianzaLuego podemos usar las observaciones pasadas para determinar la media y la varianza dede la siguiente manera.
Primero, estimamos la mediay varianzade la distribución marginal deutilizando el método de máxima verosimilitud :
A continuación, utilizamos la ley de la esperanza total para calculary la ley de la varianza total para calcularde tal manera que
dóndeyson los momentos de la distribución condicional, que se suponen conocidos. En particular, supongamos quey eso; entonces tenemos
Finalmente, obtenemos los momentos estimados de la distribución a priori,
Por ejemplo, siy si asumimos una distribución a priori normal (que en este caso es una distribución a priori conjugada), concluimos que, a partir del cual el estimador bayesiano deResidencia ense puede calcular.
Propiedades
Admisibilidad
Las reglas bayesianas con riesgo bayesiano finito suelen ser admisibles . A continuación se presentan algunos ejemplos específicos de teoremas de admisibilidad.
- Si una regla de Bayes es única, entonces es admisible. [ 7 ] Por ejemplo, como se indicó anteriormente, bajo el error cuadrático medio (ECM), la regla de Bayes es única y, por lo tanto, admisible.
- Si θ pertenece a un conjunto discreto , entonces todas las reglas de Bayes son admisibles.
- Si θ pertenece a un conjunto continuo (no discreto) y si la función de riesgo R(θ,δ) es continua en θ para cada δ, entonces todas las reglas de Bayes son admisibles.
Por el contrario, las reglas bayesianas generalizadas a menudo tienen un riesgo bayesiano indefinido en el caso de distribuciones previas impropias. Estas reglas suelen ser inadmisibles y la verificación de su admisibilidad puede ser difícil. Por ejemplo, el estimador bayesiano generalizado de un parámetro de localización θ basado en muestras gaussianas (descrito en la sección "Estimador bayesiano generalizado" anterior) es inadmisible para; esto se conoce como el fenómeno de Stein .
Eficiencia asintótica
Sea θ una variable aleatoria desconocida, y supongamos queson muestras iid con densidad. Dejarsea una secuencia de estimadores bayesianos de θ basados en un número creciente de mediciones. Estamos interesados en analizar el desempeño asintótico de esta secuencia de estimadores, es decir, el desempeño depara n grande .
Para ello, es habitual considerar a θ como un parámetro determinista cuyo verdadero valor es. Bajo ciertas condiciones, [ 8 ] para muestras grandes (valores grandes de n ), la densidad posterior de θ es aproximadamente normal. En otras palabras, para n grande , el efecto de la probabilidad previa sobre la posterior es insignificante. Además, si δ es el estimador bayesiano bajo riesgo de MSE, entonces es asintóticamente insesgado y converge en distribución a la distribución normal :
donde I (θ 0 ) es la información de Fisher de θ 0 . De ello se deduce que el estimador bayesiano δ n bajo MSE es asintóticamente eficiente .
Otro estimador asintóticamente normal y eficiente es el estimador de máxima verosimilitud (EMV). La relación entre los estimadores de máxima verosimilitud y bayesianos se puede ilustrar con el siguiente ejemplo sencillo.
Ejemplo: estimación de p en una distribución binomial
Consideremos el estimador de θ basado en una muestra binomial x ~b(θ, n ), donde θ denota la probabilidad de éxito. Suponiendo que θ se distribuye según la distribución a priori conjugada, que en este caso es la distribución Beta B( a , b ), se sabe que la distribución a posteriori es B(a+x,b+nx). Por lo tanto, el estimador bayesiano bajo el error cuadrático medio es
El MLE en este caso es x/n y por lo tanto obtenemos,
La última ecuación implica que, para n → ∞, el estimador bayesiano (en el problema descrito) está cerca del MLE.
Por otro lado, cuando n es pequeño, la información previa sigue siendo relevante para el problema de decisión y afecta la estimación. Para ver el peso relativo de la información previa, supongamos que a = b ; en este caso, cada medición aporta 1 bit nuevo de información; la fórmula anterior muestra que la información previa tiene el mismo peso que a+b bits de la nueva información. En las aplicaciones, a menudo se sabe muy poco sobre los detalles de la distribución previa; en particular, no hay razón para suponer que coincide exactamente con B( a , b ). En tal caso, una posible interpretación de este cálculo es: "existe una distribución previa no patológica con un valor medio de 0,5 y una desviación estándar d que da como resultado un peso de la información previa igual a 1/(4d² ) -1 bits de nueva información".
Otro ejemplo del mismo fenómeno es el caso en que la estimación previa y una medición tienen una distribución normal. Si la estimación previa está centrada en B con desviación Σ, y la medición está centrada en b con desviación σ, entonces la estimación posterior está centrada enEn este promedio ponderado, los pesos son α=σ² y β=Σ². Además, la desviación posterior al cuadrado es Σ²+σ². En otras palabras, la distribución a priori se combina con la medición exactamente igual que si se tratara de una medición adicional a tener en cuenta.
Por ejemplo, si Σ=σ/2, entonces la desviación de 4 mediciones combinadas coincide con la desviación de la distribución a priori (suponiendo que los errores de medición son independientes). Y los pesos α,β en la fórmula para la distribución a posteriori coinciden con esto: el peso de la distribución a priori es 4 veces el peso de la medición. Al combinar esta distribución a priori con n mediciones con un promedio v, se obtiene la distribución a posteriori centrada enEn particular, la distribución a priori desempeña el mismo papel que cuatro mediciones realizadas previamente. En general, la distribución a priori tiene un peso de (σ/Σ)² mediciones.
Compárese con el ejemplo de la distribución binomial: allí, la distribución a priori tiene un peso de (σ/Σ)²−1 mediciones. Se puede observar que el peso exacto depende de los detalles de la distribución, pero cuando σ≫Σ, la diferencia se vuelve pequeña.
Ejemplo práctico de estimadores bayesianos
La base de datos de películas de Internet (IMDb) utiliza una fórmula para calcular y comparar las calificaciones de las películas por parte de sus usuarios, incluyendo sus 250 títulos mejor calificados, la cual, según afirman, proporciona "una verdadera estimación bayesiana". [ 9 ] La siguiente fórmula bayesiana se utilizó inicialmente para calcular una puntuación promedio ponderada para los 250 títulos mejor calificados, aunque la fórmula ha cambiado desde entonces:
dónde:
- = calificación ponderada
- = calificación promedio de la película como un número del 1 al 10 (media) = (Calificación)
- = número de votos/calificaciones para la película = (votos)
- = peso asignado a la estimación previa (en este caso, el número de votos que IMDB consideró necesarios para que la calificación promedio se aproximara a la validez estadística)
- = el voto medio en todo el grupo (actualmente 7,0)
Nótese que W es simplemente la media aritmética ponderada de R y C con vector de ponderación (v, m) . A medida que el número de calificaciones supera m , la confianza de la calificación promedio supera la confianza del voto promedio para todas las películas (C), y la calificación bayesiana ponderada (W) se aproxima a un promedio simple (R). Cuanto más cerca de cero esté v (el número de calificaciones para la película), más cerca estará W de C , donde W es la calificación ponderada y C es la calificación promedio de todas las películas. Por lo tanto, en términos más simples, cuantas menos calificaciones/votos se emitan para una película, más sesgará su calificación ponderada hacia el promedio de todas las películas, mientras que las películas con muchas calificaciones/votos tendrán una calificación que se aproxime a su calificación promedio aritmética pura.
El método de IMDb garantiza que una película con solo unas pocas calificaciones, todas de 10, no se sitúe por encima de "El Padrino", por ejemplo, que tiene una media de 9,2 basada en más de 500.000 valoraciones.
Véase también
Notas
- ↑ Lehmann y Casella, Teorema 4.1.1
- 1 2 Lehmann y Casella, Definición 4.2.9
- ↑ Jaynes, ET (2007). Teoría de la probabilidad: La lógica de la ciencia ( 5.ª ed. impresa). Cambridge [ua]: Cambridge Univ. Press. p. 172. ISBN 978-0-521-59271-0.
- ↑ Bassett, Robert; Deride, Julio (marzo de 2019). "Estimadores a posteriori máximos como límite de los estimadores bayesianos". Mathematical Programming . 174 ( 1–2 ): 129–144 . arXiv : 1611.05917 . doi : 10.1007/s10107-018-1241-0 .
- ↑ Dytso, A.; Bustin, R.; Tuninetti, D.; Devroye, N.; Poor, HV; Shamai Shitz, S. (2018). "Sobre el mínimo error medio pth en canales de ruido gaussiano y sus aplicaciones". IEEE Transactions on Information Theory . 64 (3). IEEE : 2012–2037 . arXiv : 1607.01461 . doi : 10.1109/TIT.2017.2782786 .
- ↑ Berger (1980), sección 4.5.
- ↑ Lehmann y Casella (1998), Teorema 5.2.4.
- ↑ Lehmann y Casella (1998), sección 6.8
- ↑ "IMDb Top 250" . Archivado del original el 1 de junio de 2012.
Referencias
- Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª ed.). Nueva York: Springer-Verlag. ISBN 0-387-96098-8MR 0804611 .
- Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2.ª ed.). Springer. ISBN 0-387-98502-6.
- Pilz, Jürgen (1991). «Estimación bayesiana». Estimación bayesiana y diseño experimental en modelos de regresión lineal . Chichester: John Wiley & Sons. pp. 38–117 . ISBN 0-471-91732-X.
Enlaces externos
- "Estimador bayesiano" , Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
- Estimador
- Estimación bayesiana