Empirical Bayes methods are procedures for statistical inference in which the prior probability distribution is estimated from the data. This approach stands in contrast to standard Bayesian methods, for which the prior distribution is fixed before any data are observed. Despite this difference in perspective, empirical Bayes may be viewed as an approximation to a fully Bayesian treatment of a hierarchical model wherein the parameters at the highest level of the hierarchy are set to their most likely values, instead of being integrated out.[1]
Introduction
Empirical Bayes methods can be seen as an approximation to a fully Bayesian treatment of a hierarchical Bayes model.
In, for example, a two-stage hierarchical Bayes model, observed data are assumed to be generated from an unobserved set of parameters according to a probability distribution . In turn, the parameters can be considered samples drawn from a population characterised by hyperparameters according to a probability distribution . In the hierarchical Bayes model, though not in the empirical Bayes approximation, the hyperparameters are considered to be drawn from an unparameterized distribution .
Information about a particular quantity of interest therefore comes not only from the properties of those data that directly depend on it, but also from the properties of the population of parameters as a whole, inferred from the data as a whole, summarised by the hyperparameters .
Using Bayes' theorem,
In general, this integral will not be tractable analytically or symbolically and must be evaluated by numerical methods. Stochastic (random) or deterministic approximations may be used. Example stochastic methods are Markov Chain Monte Carlo and Monte Carlo sampling. Deterministic approximations are discussed in quadrature.
Alternatively, the expression can be written as
and the final factor in the integral can in turn be expressed as
These suggest an iterative scheme, qualitatively similar in structure to a Gibbs sampler, to evolve successively improved approximations to and . First, calculate an initial approximation to ignoring the dependence completely; then calculate an approximation to based upon the initial approximate distribution of ; then use this to update the approximation for ; then update ; and so on.
When the true distribution is sharply peaked, the integral determining may be not much changed by replacing the probability distribution over with a point estimate representing the distribution's peak (or, alternatively, its mean),
Con esta aproximación, el esquema iterativo anterior se convierte en el algoritmo EM .
El término "Bayes empírico" puede abarcar una amplia variedad de métodos, pero la mayoría pueden considerarse una versión truncada del esquema anterior o algo muy similar. Normalmente se utilizan estimaciones puntuales, en lugar de la distribución completa, para el/los parámetro(s).Las estimaciones parase suelen realizar a partir de la primera aproximación asin refinamiento posterior. Estas estimaciones paraPor lo general, se realizan sin considerar una distribución previa adecuada para.
Estimación puntual
Método de Robbins: Bayes empírico no paramétrico (NPEB)
Robbins [ 2 ] consideró un caso de muestreo de una distribución mixta , donde la probabilidad para cada(condicionado a) se especifica mediante una distribución de Poisson ,
mientras que la distribución a priori de θ no está especificada excepto que también es i.i.d. de una distribución desconocida, con función de distribución acumulativaEl muestreo compuesto surge en una variedad de problemas de estimación estadística, como tasas de accidentes y ensayos clínicos. Simplemente buscamos una predicción puntual dedados todos los datos observados. Debido a que la distribución a priori no está especificada, buscamos hacer esto sin conocimiento de G. [ 3 ]
Bajo la pérdida de error cuadrático (SEL), la esperanza condicional E( θ i | Y i = y i ) es una cantidad razonable para usar en la predicción. Para el modelo de muestreo compuesto de Poisson, esta cantidad es
Esto se puede simplificar multiplicando tanto el numerador como el denominador por, produciendo
donde p G es la función de masa de probabilidad marginal obtenida al integrar θ sobre G.
Para aprovechar esto, Robbins [ 2 ] sugirió estimar los marginales con sus frecuencias empíricas (), lo que da como resultado la estimación totalmente no paramétrica:
dóndedenota "número de". (Véase también Estimación de frecuencia de Good-Turing ).
- Ejemplo: Tasas de accidentes
Supongamos que cada cliente de una compañía de seguros tiene una "tasa de accidentes" Θ y está asegurado contra accidentes; la distribución de probabilidad de Θ es la distribución subyacente y es desconocida. El número de accidentes sufridos por cada cliente en un período de tiempo determinado sigue una distribución de Poisson con un valor esperado igual a la tasa de accidentes de ese cliente en particular. El número real de accidentes experimentados por un cliente es la cantidad observable. Una forma aproximada de estimar la distribución de probabilidad subyacente de la tasa de accidentes Θ es estimar la proporción de miembros de la población total que sufren 0, 1, 2, 3, ... accidentes durante el período de tiempo especificado como la proporción correspondiente en la muestra aleatoria observada. Una vez hecho esto, se desea predecir la tasa de accidentes de cada cliente en la muestra. Como se mencionó anteriormente, se puede utilizar el valor esperado condicional de la tasa de accidentes Θ dado el número observado de accidentes durante el período de referencia. Así, si un cliente sufre seis accidentes durante el período de referencia, su tasa estimada de accidentes es 7 × [la proporción de la muestra que sufrió 7 accidentes] / [la proporción de la muestra que sufrió 6 accidentes]. Cabe destacar que si la proporción de personas que sufren k accidentes es una función decreciente de k , la tasa de accidentes prevista para el cliente suele ser inferior al número de accidentes observados.
Este efecto de contracción es típico de los análisis bayesianos empíricos.
Gaussiana
Suponerson variables aleatorias, de tal manera quese observa, peroestá oculto. El problema es encontrar la expectativa de, condicionado aSupongamos además que, eso es,, dóndees una gaussiana multivariada con varianza.
Entonces, tenemos la fórmulamediante cálculo directo con la función de densidad de probabilidad de gaussianas multivariadas. Integrando sobre, obtenemosEn particular, esto significa que se puede realizar una estimación bayesiana desin acceso a la densidad previa deo la densidad posterior de. El único requisito es tener acceso a la función de puntuación deEsto tiene aplicaciones en el modelado generativo basado en puntuaciones . [ 4 ]
Bayes empírico paramétrico
Si la función de verosimilitud y su distribución a priori adoptan formas paramétricas simples (como funciones de verosimilitud unidimensionales o bidimensionales con distribuciones a priori conjugadas simples ), entonces el problema bayesiano empírico consiste únicamente en estimar la distribución marginal.y los hiperparámetrosutilizando el conjunto completo de mediciones empíricas. Por ejemplo, un enfoque común, llamado estimación puntual bayesiana empírica paramétrica, consiste en aproximar la marginal utilizando la estimación de máxima verosimilitud (MLE), o una expansión de momentos , lo que permite expresar los hiperparámetros.en términos de la media y la varianza empíricas. Esta marginal simplificada permite sustituir los promedios empíricos en una estimación puntual para la distribución a priori.. La ecuación resultante para el anteriorse simplifica enormemente, como se muestra a continuación.
Existen varios modelos bayesianos empíricos paramétricos comunes, entre los que se incluyen el modelo Poisson-gamma (véase más abajo), el modelo beta-binomial , el modelo gaussiano-gaussiano , el modelo multinomial de Dirichlet , así como modelos específicos para la regresión lineal bayesiana (véase más abajo) y la regresión lineal multivariante bayesiana . Entre los enfoques más avanzados se incluyen los modelos bayesianos jerárquicos y los modelos de mezcla bayesiana .
modelo gaussiano-gaussiano
Para ver un ejemplo de estimación bayesiana empírica utilizando un modelo gaussiano-gaussiano, consulte Estimadores bayesianos empíricos .
modelo de Poisson-gamma
Por ejemplo, en el ejemplo anterior, sea la probabilidad una distribución de Poisson y sea la distribución a priori especificada ahora por la distribución a priori conjugada , que es una distribución gamma () (dónde):
Es sencillo demostrar que la distribución posterior también es una distribución gamma. Escriba
donde se ha omitido la distribución marginal ya que no depende explícitamente de. Ampliar los términos que dependen deda como resultado la distribución posterior:
Por lo tanto, la densidad posterior también es una distribución gamma., dónde, y. Nótese también que la marginal es simplemente la integral de la posterior sobre todas las, que resulta ser una distribución binomial negativa .
Para aplicar el método bayesiano empírico, aproximaremos la distribución marginal utilizando la estimación de máxima verosimilitud (EMV). Pero dado que la distribución posterior es una distribución gamma, la EMV de la distribución marginal resulta ser simplemente la media de la distribución posterior, que es la estimación puntual.lo necesitamos. Recordando que la mediade una distribución gammaes simplemente, tenemos
Para obtener los valores dey, el método bayesiano empírico prescribe la estimación de la mediay varianzautilizando el conjunto completo de datos empíricos.
La estimación puntual resultantees, por lo tanto, como un promedio ponderado de la media de la muestra.y la media previaEsto resulta ser una característica general del método bayesiano empírico; las estimaciones puntuales para la distribución a priori (es decir, la media) se verán como promedios ponderados de la estimación de la muestra y la estimación a priori (lo mismo ocurre con las estimaciones de la varianza).
Véase también
Referencias
- ↑ Carlin, Bradley P.; Louis, Thomas A. (2002). «Bayes empírico: pasado, presente y futuro». En Raftery, Adrian E.; Tanner, Martin A.; Wells, Martin T. (eds.). Estadística en el siglo XXI . Chapman & Hall. pp. 312–318 . ISBN 1-58488-272-7.
- 1 2 Robbins, Herbert (1956). "Un enfoque bayesiano empírico para la estadística" . Avances en estadística . Serie Springer en estadística. págs. 157–163 . doi : 10.1007/978-1-4612-0919-5_26 . ISBN 978-0-387-94037-3. SR 0084919 .
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Carlin, Bradley P.; Louis, Thomas A. (2000). Métodos bayesianos y bayesianos empíricos para el análisis de datos (2.ª ed.). Chapman & Hall/CRC. págs. Sec. 3.2 y Apéndice B. ISBN 978-1-58488-170-4.
- ^ Saremi, Saeed; Hyvärinen, Aapo (2019). "Bayes neuronales empíricos" . Revista de investigación sobre aprendizaje automático . 20 (181): 1– 23. ISSN 1533-7928 .
Lecturas adicionales
- Peter E. Rossi; Greg M. Allenby; Rob McCulloch (14 de mayo de 2012). Estadística bayesiana y marketing . John Wiley & Sons. ISBN 978-0-470-86368-8.
- Casella, George (mayo de 1985). "Una introducción al análisis de datos bayesiano empírico" ( PDF) . American Statistician . 39 (2): 83– 87. doi : 10.2307/2682801 . hdl : 1813/32886 . JSTOR 2682801. MR 0789118 .
- Nikulin, Mikhail (1987). "Las condiciones de regularidad de Bernstein en un problema del enfoque bayesiano empírico" . Journal of Soviet Mathematics . 36 (5): 596– 600. doi : 10.1007/BF01093293 . S2CID 122405908 .
Enlaces externos
- Uso del método bayesiano empírico para estimar la seguridad vial (Norteamérica)
- Métodos bayesianos empíricos para el análisis de datos faltantes
- Utilización de la distribución beta-binomial para evaluar el rendimiento de un dispositivo de identificación biométrica.
- Clasificadores bayesianos ingenuos jerárquicos (para variables continuas y discretas ).
- estadística bayesiana no paramétrica