Articulo de referencia

Probabilidad marginal

La verosimilitud marginal es una función de verosimilitud integrada sobre el espacio de parámetros . En estadística bayesiana , representa la probabilidad de generar la muestra ...

La verosimilitud marginal es una función de verosimilitud integrada sobre el espacio de parámetros . En estadística bayesiana , representa la probabilidad de generar la muestra observada para todos los valores posibles de los parámetros; puede entenderse como la probabilidad del modelo en sí y, por lo tanto, a menudo se la denomina evidencia del modelo o simplemente evidencia .

Debido a la integración sobre el espacio de parámetros, la verosimilitud marginal no depende directamente de los parámetros. Si el objetivo no es la comparación de modelos, la verosimilitud marginal es simplemente la constante de normalización que garantiza que la distribución posterior sea una probabilidad adecuada. Está relacionada con la función de partición en mecánica estadística . [ 1 ]

Concepto

Dado un conjunto de puntos de datos independientes e idénticamente distribuidosincógnita=(incógnita1,,incógnitanorte),{\displaystyle \mathbf {X} =(x_{1},\ldots ,x_{n}),}dóndeincógnitaipag(incógnita|θ){\displaystyle x_{i}\sim p(x|\theta )}según alguna distribución de probabilidad parametrizada porθ{\displaystyle \theta }, dóndeθ{\displaystyle \theta }en sí misma es una variable aleatoria descrita por una distribución, es decirθpag(θα),{\displaystyle \theta \sim p(\theta \mid \alpha ),}La verosimilitud marginal en general pregunta cuál es la probabilidadpag(incógnitaα){\displaystyle p(\mathbf {X} \mid \alpha )}es, dondeθ{\displaystyle \theta }ha sido marginado (integrado):

pag(incógnitaα)=θpag(incógnitaθ)pag(θα) dθ{\displaystyle p(\mathbf {X} \mid \alpha )=\int _{\theta }p(\mathbf {X} \mid \theta )\,p(\theta \mid \alpha )\ \operatorname {d} \!\theta }

La definición anterior está formulada en el contexto de la estadística bayesiana en cuyo casopag(θα){\displaystyle p(\theta \mid \alpha )}se denomina densidad previa ypag(incógnitaθ){\displaystyle p(\mathbf {X} \mid \theta )}es la probabilidad. Reconociendo que la probabilidad marginal es la constante de normalización de la densidad posterior bayesianapag(θincógnita,α){\displaystyle p(\theta \mid \mathbf {X} ,\alpha )}, también se tiene la expresión alternativa [ 2 ]

pag(incógnitaα)=pag(incógnitaθ,α)pag(θα)pag(θincógnita,α){\displaystyle p(\mathbf {X} \mid \alpha )={\frac {p(\mathbf {X} \mid \theta ,\alpha )p(\theta \mid \alpha )}{p(\theta \mid \mathbf {X} ,\alpha )}}}

que es una identidad enθ{\displaystyle \theta }La verosimilitud marginal cuantifica la concordancia entre los datos y la distribución a priori en un sentido geométrico, precisado mediante espacios de Hilbert en de Carvalho et al. (2019). En la estadística clásica ( frecuentista ), el concepto de verosimilitud marginal aparece en el contexto de un parámetro conjunto.θ=(ψ,λ){\displaystyle \theta =(\psi ,\lambda )}, dóndeψ{\displaystyle \psi }es el parámetro real de interés, yλ{\displaystyle \lambda }es un parámetro molesto no interesante . Si existe una distribución de probabilidad paraλ{\displaystyle \lambda }, a menudo es deseable considerar la función de verosimilitud solo en términos deψ{\displaystyle \psi }al marginarλ{\displaystyle \lambda }:

L(ψ;incógnita)=pag(incógnitaψ)=λpag(incógnitaλ,ψ)pag(λψ) dλ{\displaystyle {\mathcal {L}}(\psi ;\mathbf {X} )=p(\mathbf {X} \mid \psi )=\int _{\lambda }p(\mathbf {X} \mid \lambda ,\psi )\,p(\lambda \mid \psi )\ \operatorname {d} \!\lambda }

Desafortunadamente, las probabilidades marginales suelen ser difíciles de calcular. Se conocen soluciones exactas para una pequeña clase de distribuciones, especialmente cuando el parámetro marginalizado es la distribución a priori conjugada de los datos. En otros casos, se requiere algún método de integración numérica , ya sea un método general como la integración gaussiana o el método de Monte Carlo , o un método especializado para problemas estadísticos como la aproximación de Laplace , el muestreo de Gibbs / Metropolis o el algoritmo EM .

También es posible aplicar las consideraciones anteriores a una sola variable aleatoria (punto de datos).incógnita{\displaystyle x}, en lugar de un conjunto de observaciones. En un contexto bayesiano, esto es equivalente a la distribución predictiva previa de un punto de datos.

Aplicaciones

Comparación de modelos bayesianos

En la comparación de modelos bayesianos , las variables marginalizadasθ{\displaystyle \theta }son parámetros para un tipo particular de modelo, y la variable restanteMETRO{\displaystyle M}es la identidad del modelo en sí. En este caso, la verosimilitud marginalizada es la probabilidad de los datos dado el tipo de modelo, sin asumir ningún parámetro particular del modelo. Escribiendoθ{\displaystyle \theta }Para los parámetros del modelo, la verosimilitud marginal para el modelo M es

pag(incógnitaMETRO)=pag(incógnitaθ,METRO)pag(θMETRO)dθ{\displaystyle p(\mathbf {X} \mid M)=\int p(\mathbf {X} \mid \theta ,M)\,p(\theta \mid M)\,\operatorname {d} \!\theta }

Es en este contexto donde normalmente se utiliza el término evidencia del modelo . Esta cantidad es importante porque la razón de probabilidades posterior para un modelo M 1 frente a otro modelo M 2 implica una razón de verosimilitudes marginales, llamada factor de Bayes :

pag(METRO1incógnita)pag(METRO2incógnita)=pag(METRO1)pag(METRO2)pag(incógnitaMETRO1)pag(incógnitaMETRO2){\displaystyle {\frac {p(M_{1}\mid \mathbf {X} )}{p(M_{2}\mid \mathbf {X} )}}={\frac {p(M_{1})}{p(M_{2})}}\,{\frac {p(\mathbf {X} \mid M_{1})}{p(\mathbf {X} \mid M_{2})}}}

que puede expresarse esquemáticamente como

Probabilidad posterior = probabilidad previa × factor de Bayes

Véase también

Referencias

  1. Šmídl, Václav; Quinn, Anthony (2006). "Teoría bayesiana". El método variacional bayesiano en el procesamiento de señales . Springer. pp. 13–23 . doi : 10.1007/3-540-28820-1_2 . 
  2. Chib, Siddhartha (1995). "Verosimilitud marginal a partir de la salida de Gibbs". Journal of the American Statistical Association . 90 (432): 1313– 1321. doi : 10.1080/01621459.1995.10476635 .

Lecturas adicionales

  • Charles S. Bos. «Una comparación de métodos de cálculo de verosimilitud marginal». En W. Härdle y B. Ronz, editores, COMPSTAT 2002: Actas de Estadística Computacional , págs.  111-117 . 2002. (Disponible como preimpresión en SSRN 332860 ). 
  • de Carvalho, Miguel; Page, Garritt; Barney, Bradley (2019). "Sobre la geometría de la inferencia bayesiana". Análisis bayesiano . 14 (4): 1013‒1036. (Disponible como preimpresión en la web:)
  • Lambert, Ben (2018). «El diablo está en el denominador». Guía para estudiantes de estadística bayesiana . Sage. págs. 109-120 . ISBN  978-1-4739-1636-4.
  • El libro de texto en línea: Teoría de la información, inferencia y algoritmos de aprendizaje , de David JC MacKay .