Articulo de referencia

Modelado jerárquico bayesiano

El modelado jerárquico bayesiano es un modelo estadístico escrito en múltiples niveles (forma jerárquica) que estima la distribución posterior de los parámetros del modelo media...

El modelado jerárquico bayesiano es un modelo estadístico escrito en múltiples niveles (forma jerárquica) que estima la distribución posterior de los parámetros del modelo mediante el método bayesiano . [ 1 ] Los submodelos se combinan para formar el modelo jerárquico, y el teorema de Bayes se utiliza para integrarlos con los datos observados y tener en cuenta toda la incertidumbre presente. Esta integración permite calcular la distribución posterior actualizada sobre los (hiper)parámetros, actualizando así las creencias previas a la luz de los datos observados.

La estadística frecuentista puede arrojar conclusiones aparentemente incompatibles con las ofrecidas por la estadística bayesiana debido al tratamiento bayesiano de los parámetros como variables aleatorias y su uso de información subjetiva para establecer supuestos sobre estos parámetros. [ 2 ] Dado que los enfoques responden a preguntas diferentes, los resultados formales no son técnicamente contradictorios, pero ambos enfoques discrepan sobre qué respuesta es relevante para aplicaciones particulares. Los bayesianos argumentan que la información relevante sobre la toma de decisiones y la actualización de creencias no puede ignorarse y que el modelado jerárquico tiene el potencial de superar los métodos clásicos en aplicaciones donde los encuestados proporcionan múltiples datos de observación. Además, el modelo ha demostrado ser robusto , con la distribución posterior menos sensible a las distribuciones previas jerárquicas más flexibles.

El modelado jerárquico, como su nombre lo indica, conserva una estructura de datos anidada y se utiliza cuando la información está disponible en varios niveles diferentes de unidades de observación. Por ejemplo, en el modelado epidemiológico para describir las trayectorias de infección en varios países, las unidades de observación son los países, y cada país tiene su propio perfil temporal de casos diarios infectados. [ 3 ] En el análisis de curvas de declive para describir la curva de declive de la producción de petróleo o gas en múltiples pozos, las unidades de observación son los pozos de petróleo o gas en una región de yacimiento, y cada pozo tiene su propio perfil temporal de tasas de producción de petróleo o gas (generalmente, barriles por mes). [ 4 ] El modelado jerárquico se utiliza para diseñar estrategias basadas en cálculos para problemas multiparamétricos. [ 5 ]

Filosofía

Los métodos y modelos estadísticos suelen involucrar múltiples parámetros que pueden considerarse relacionados o conectados de tal manera que el problema implica una dependencia del modelo de probabilidad conjunta para estos parámetros. [ 6 ] Los grados individuales de creencia, expresados ​​en forma de probabilidades, conllevan incertidumbre. [ 7 ] En medio de esto está el cambio de los grados de creencia a lo largo del tiempo. Como afirmaron el profesor José M. Bernardo y el profesor Adrian F. Smith , "La realidad del proceso de aprendizaje consiste en la evolución de las creencias individuales y subjetivas sobre la realidad". Estas probabilidades subjetivas están más directamente involucradas en la mente que las probabilidades físicas. [ 7 ] Por lo tanto, es con esta necesidad de actualizar las creencias que los bayesianos han formulado un modelo estadístico alternativo que toma en cuenta la ocurrencia previa de un evento particular. [ 8 ]

Teorema de Bayes

La supuesta ocurrencia de un evento del mundo real generalmente modificará las preferencias entre ciertas opciones. Esto se logra modificando el grado de creencia que un individuo asocia a los eventos que definen las opciones. [ 9 ]

Supongamos que en un estudio sobre la efectividad de los tratamientos cardíacos, los pacientes del hospital j tienen una probabilidad de supervivenciaθj{\displaystyle \theta _{j}}, la probabilidad de supervivencia se actualizará con la ocurrencia de y , el evento en el que se crea un suero controvertido que, según algunos, aumenta la supervivencia en pacientes cardíacos.

Para hacer afirmaciones de probabilidad actualizadas sobreθj{\displaystyle \theta _{j}}, dada la ocurrencia del evento y , debemos comenzar con un modelo que proporcione una distribución de probabilidad conjunta paraθj{\displaystyle \theta _{j}}y y . Esto se puede escribir como un producto de las dos distribuciones que a menudo se denominan distribución a priori.PAG(θ){\displaystyle P(\theta )}y la distribución del muestreoPAG(yθ){\displaystyle P(y\mid \theta )}respectivamente:

PAG(θ,y)=PAG(θ)PAG(yθ){\displaystyle P(\theta ,y)=P(\theta )P(y\mid \theta )}

Utilizando la propiedad básica de la probabilidad condicional , la distribución posterior dará como resultado:

PAG(θy)=PAG(θ,y)PAG(y)=PAG(yθ)PAG(θ)PAG(y){\displaystyle P(\theta \mid y)={\frac {P(\theta ,y)}{P(y)}}={\frac {P(y\mid \theta )P(\theta )}{P(y)}}}

Esta ecuación, que muestra la relación entre la probabilidad condicional y los eventos individuales, se conoce como el teorema de Bayes. Esta expresión simple encapsula el núcleo técnico de la inferencia bayesiana que tiene como objetivo deconstruir la probabilidad,PAG(θy){\displaystyle P(\theta \mid y)}, en relación con los subconjuntos resolubles de su evidencia de apoyo. [ 9 ]

Intercambiabilidad

El punto de partida habitual de un análisis estadístico es la suposición de que los valores ny1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}}son intercambiables. Si no hay información, aparte de los datos y , disponible para distinguir alguno de losθj{\displaystyle \theta _{j}}Dado que no se puede ordenar ni agrupar ningún parámetro, se debe asumir la simetría de los parámetros de la distribución previa. [ 10 ] Esta simetría se representa probabilísticamente mediante la intercambiabilidad. Generalmente, es útil y apropiado modelar los datos de una distribución intercambiable como independientes e idénticamente distribuidos , dado algún vector de parámetros desconocido .θ{\displaystyle \theta }, con distribuciónPAG(θ){\displaystyle P(\theta )}.

Intercambiabilidad finita

Para un número fijo n , el conjuntoy1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}} es intercambiable si la probabilidad conjuntaPAG(y1,y2,,ynorte){\displaystyle P(y_{1},y_{2},\ldots,y_{n})}es invariante bajo permutaciones de los índices. Es decir, para cada permutaciónπ{\displaystyle \pi }o(π1,π2,,πnorte){\displaystyle (\pi _{1},\pi _{2},\ldots ,\pi _{n})} de (1, 2, …, n ),PAG(y1,y2,,ynorte)=PAG(yπ1,yπ2,,yπnorte).{\displaystyle P(y_{1},y_{2},\ldots ,y_{n})=P(y_{\pi _{1}},y_{\pi _{2}},\ldots ,y_{\pi _{n}}).}[ 11 ]

El siguiente es un ejemplo intercambiable, pero no independiente e idéntico (iid): Considere una urna con una bola roja y una bola azul en su interior, con probabilidad12{\displaystyle {\frac {1}{2}}}de sacar cualquiera de las dos. Las bolas se sacan sin reemplazo, es decir, después de que se saca una bola de lanorte{\displaystyle n}bolas, habránorte1{\displaystyle n-1}Bolas restantes para el próximo sorteo.

Dejar Yi={1,si el iLa pelota es roja,0,de lo contrario.{\displaystyle {\text{Sea }}Y_{i}={\begin{cases}1,&{\text{si la }}i{\text{bola} es roja}},\\0,&{\text{en otro caso}}.\end{cases}}}

La probabilidad de seleccionar una bola roja en el primer sorteo y una bola azul en el segundo es igual a la probabilidad de seleccionar una bola azul en el primer sorteo y una roja en el segundo, ambas iguales a 1/2:

PAG(y1=1,y2=0)=PAG(y1=0,y2=1)=12{\displaystyle P(y_{1}=1,y_{2}=0)=P(y_{1}=0,y_{2}=1)={\frac {1}{2}}}.

Esto hace quey1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}cambiable.

Pero la probabilidad de seleccionar una bola roja en el segundo sorteo, dado que la bola roja ya fue seleccionada en el primero, es 0. Esto no es igual a la probabilidad de que la bola roja sea seleccionada en el segundo sorteo, que es 1/2:

PAG(y2=1y1=1)=0PAG(y2=1)=12{\displaystyle P(y_{2}=1\mid y_{1}=1)=0\neq P(y_{2}=1)={\frac {1}{2}}}.

De este modo,y1{\displaystyle y_{1}}yy2{\displaystyle y_{2}}no son independientes.

Siincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}Si son independientes e idénticamente distribuidas, entonces son intercambiables, pero lo contrario no es necesariamente cierto. [ 12 ]

Intercambiabilidad infinita

La intercambiabilidad infinita es la propiedad de que todo subconjunto finito de una secuencia infinitay1{\displaystyle y_{1}},y2,{\displaystyle y_{2},\ldots }es intercambiable. Para cualquier n , la secuenciay1,y2,,ynorte{\displaystyle y_{1},y_{2},\ldots,y_{n}}es intercambiable. [ 12 ]

Modelos jerárquicos

Componentes

El modelado jerárquico bayesiano utiliza dos conceptos importantes para derivar la distribución posterior, [ 1 ] a saber:

  1. Hiperparámetros : parámetros de la distribución a priori
  2. Hiperpriores : distribuciones de hiperparámetros

Supongamos que una variable aleatoria Y sigue una distribución normal con parámetroθ{\displaystyle \theta }como la media y 1 como la varianza , es decirYθnorte(θ,1){\displaystyle Y\mid \theta \sim N(\theta ,1)}La relación de la tilde{\displaystyle \sim }puede leerse como "tiene la distribución de" o "se distribuye como". Supongamos también que el parámetroθ{\displaystyle \theta }tiene una distribución dada por una distribución normal con mediaμ{\displaystyle \mu }y varianza 1, es decirθμnorte(μ,1){\displaystyle \theta \mid \mu \sim N(\mu,1)}. Además,μ{\displaystyle \mu } follows another distribution given, for example, by the standard normal distribution, N(0,1){\displaystyle {\text{N}}(0,1)}. The parameter μ{\displaystyle \mu } is called the hyperparameter, while its distribution given by N(0,1){\displaystyle {\text{N}}(0,1)} is an example of a hyperprior distribution. The notation of the distribution of Y changes as another parameter is added, i.e. Yθ,μN(θ,1){\displaystyle Y\mid \theta ,\mu \sim N(\theta ,1)}. If there is another stage, say, μ{\displaystyle \mu } following another normal distribution with a mean of β{\displaystyle \beta } and a variance of ϵ{\displaystyle \epsilon }, then μN(β,ϵ){\displaystyle \mu \sim N(\beta,\epsilon)},  {\displaystyle {\mbox{ }}}β{\displaystyle \beta } and ϵ{\displaystyle \epsilon } can also be called hyperparameters with hyperprior distributions.[6]

Framework

Let yj{\displaystyle y_{j}} be an observation and θj{\displaystyle \theta _{j}} a parameter governing the data generating process for yj{\displaystyle y_{j}}. Assume further that the parameters θ1,θ2,,θj{\displaystyle \theta _{1},\theta _{2},\ldots ,\theta _{j}} are generated exchangeably from a common population, with distribution governed by a hyperparameter ϕ{\displaystyle \phi }. The Bayesian hierarchical model contains the following stages:

Stage I: yjθj,ϕP(yjθj,ϕ){\displaystyle {\text{Etapa I: }}y_{j}\mid \theta _{j},\phi \sim P(y_{j}\mid \theta _{j},\phi )}
Stage II: θjϕP(θjϕ){\displaystyle {\text{Etapa II: }}\theta _{j}\mid \phi \sim P(\theta _{j}\mid \phi )}
Stage III: ϕP(ϕ){\displaystyle {\text{Etapa III: }}\phi \sim P(\phi )}

The likelihood, as seen in stage I is P(yjθj,ϕ){\displaystyle P(y_{j}\mid \theta _ {j},\phi )}, with P(θj,ϕ){\displaystyle P(\theta _ {j},\phi )} as its prior distribution. Note that the likelihood depends on ϕ{\displaystyle \phi } only through θj{\displaystyle \theta _{j}}.

The prior distribution from stage I can be broken down into:

P(θj,ϕ)=P(θjϕ)P(ϕ){\displaystyle P(\theta _{j},\phi )=P(\theta _{j}\mid \phi )P(\phi )}[from the definition of conditional probability]

With ϕ{\displaystyle \phi } as its hyperparameter with hyperprior distribution, P(ϕ){\displaystyle P(\phi )}.

Thus, the posterior distribution is proportional to:

P(ϕ,θjy)P(yjθj,ϕ)P(θj,ϕ){\displaystyle P(\phi ,\theta _{j}\mid y)\propto P(y_{j}\mid \theta _{j},\phi )P(\theta _{j},\phi )}[using Bayes' Theorem]
P(ϕ,θjy)P(yjθj)P(θjϕ)P(ϕ){\displaystyle P(\phi ,\theta _{j}\mid y)\propto P(y_{j}\mid \theta _{j})P(\theta _{j}\mid \phi )P(\phi )}[13]

Example calculation

As an example, a teacher wants to estimate how well a student did on the SAT. The teacher uses the current grade point average (GPA) of the student for an estimate. Their current GPA, denoted by Y{\displaystyle Y}, has a likelihood given by some probability function with parameter θ{\displaystyle \theta }, i.e. YθP(Yθ){\displaystyle Y\mid \theta \sim P(Y\mid \theta )}. This parameter θ{\displaystyle \theta } is the SAT score of the student. The SAT score is viewed as a sample coming from a common population distribution indexed by another parameter ϕ{\displaystyle \phi }, which is the high school grade of the student (freshman, sophomore, junior or senior).[14] That is, θϕP(θϕ){\displaystyle \theta \mid \phi \sim P(\theta \mid \phi )}. Moreover, the hyperparameter ϕ{\displaystyle \phi } follows its own distribution given by P(ϕ){\displaystyle P(\phi )}, a hyperprior.

These relationships can be used to calculate the likelihood of a specific SAT score relative to a particular GPA:

P(θ,ϕY)P(Yθ,ϕ)P(θ,ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta ,\phi )P(\theta ,\phi )}
P(θ,ϕY)P(Yθ)P(θϕ)P(ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi )}

All information in the problem will be used to solve for the posterior distribution. Instead of solving only using the prior distribution and the likelihood function, using hyperpriors allows a more nuanced distinction of relationships between given variables.[15]

2-stage hierarchical model

In general, the joint posterior distribution of interest in 2-stage hierarchical models is:

P(θ,ϕY)=P(Yθ,ϕ)P(θ,ϕ)P(Y)=P(Yθ)P(θϕ)P(ϕ)P(Y){\displaystyle P(\theta ,\phi \mid Y)={P(Y\mid \theta ,\phi )P(\theta ,\phi ) \over P(Y)}={P(Y\mid \theta )P(\theta \mid \phi )P(\phi ) \over P(Y)}}
P(θ,ϕY)P(Yθ)P(θϕ)P(ϕ){\displaystyle P(\theta ,\phi \mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi )}[15]

3-stage hierarchical model

For 3-stage hierarchical models, the posterior distribution is given by:

P(θ,ϕ,XY)=P(Yθ)P(θϕ)P(ϕX)P(X)P(Y){\displaystyle P(\theta ,\phi ,X\mid Y)={P(Y\mid \theta )P(\theta \mid \phi )P(\phi \mid X)P(X) \over P(Y)}}
P(θ,ϕ,XY)P(Yθ)P(θϕ)P(ϕX)P(X){\displaystyle P(\theta ,\phi ,X\mid Y)\propto P(Y\mid \theta )P(\theta \mid \phi )P(\phi \mid X)P(X)}[15]

Bayesian nonlinear mixed-effects model

Ciclo de investigación bayesiana utilizando un modelo bayesiano de efectos mixtos no lineales: (a) ciclo de investigación estándar y (b) flujo de trabajo específico bayesiano. [ 16 ]

Se podría utilizar una versión de tres etapas del modelado jerárquico bayesiano para calcular la probabilidad en 1) un nivel individual, 2) a nivel de población y 3) la distribución a priori, que es una distribución de probabilidad supuesta que tiene lugar antes de que se adquiera la evidencia inicial:

Etapa 1: Modelo a nivel individual

yij=F(tij;θ1i,θ2i,,θli,,θKi)+ϵij,ϵijnorte(0,σ2),i=1,,norte,j=1,,METROi.{\displaystyle {y}_{ij}=f(t_{ij};\theta _{1i},\theta _{2i},\ldots ,\theta _{li},\ldots ,\theta _{Ki})+\epsilon _{ij},\quad \epsilon _{ij}\sim N(0,\sigma ^{2}),\quad i=1,\ldots ,N,\,j=1,\ldots ,M_{i}.}

Etapa 2: Modelo de población

θli=αl+b=1PAGβlbincógnitaib+ηli,ηlinorte(0,ωl2),i=1,,norte,l=1,,K.{\displaystyle \theta _{li}=\alpha _{l}+\sum _{b=1}^{P}\beta _{lb}x_{ib}+\eta _{li},\quad \eta _{li}\sim N(0,\omega _{l}^{2}),\quad i=1,\ldots ,N,\,l=1,\ldots ,K.}

Etapa 3: Previa

σ2π(σ2),αlπ(αl),(βl1,,βlb,,βlPAG)π(βl1,,βlb,,βlPAG),ωl2π(ωl2),l=1,,K.{\displaystyle \sigma ^{2}\sim \pi (\sigma ^{2}),\quad \alpha _{l}\sim \pi (\alpha _{l}),\quad (\beta _{l1},\ldots ,\beta _{lb},\ldots ,\beta _{lP})\sim \pi (\beta _{l1},\ldots ,\beta _{lb},\ldots ,\beta _{lP}),\quad \omega _{l}^{2}\sim \pi (\omega _{l}^{2}),\quad l=1,\ldots ,K.}

Aquí,yij{\displaystyle y_{ij}}denota la respuesta continua de lai{\displaystyle i}-ésimo sujeto en el momentotij{\displaystyle t_{ij}}, yincógnitaib{\displaystyle x_{ib}}es elb{\displaystyle b}-ésima covariable de lai{\displaystyle i}-ésimo sujeto. Los parámetros involucrados en el modelo están escritos en letras griegas. La variableF(t;θ1,,θK){\displaystyle f(t;\theta _{1},\ldots ,\theta _{K})}es una función conocida parametrizada por laK{\displaystyle K}vector de -dimensiones(θ1,,θK){\displaystyle (\theta _{1},\ldots ,\theta _{K})}.

Típicamente,F{\displaystyle f}es una función "no lineal" y describe la trayectoria temporal de los individuos. En el modelo,ϵij{\displaystyle \epsilon _{ij}}y ηli{\displaystyle \eta _{li}}describen la variabilidad intraindividual y la variabilidad interindividual, respectivamente. Si no se considera la distribución a priori, la relación se reduce a un modelo frecuentista no lineal de efectos mixtos.

Una tarea central en la aplicación de los modelos bayesianos no lineales de efectos mixtos es evaluar la densidad posterior:

π({θli}i=1,l=1norte,K,σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K|{yij}i=1,j=1norte,METROi){\displaystyle \pi (\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K}|\{y_{ij}\}_{i=1,j=1}^{N,M_{i}})}

π({yij}i=1,j=1norte,METROi,{θli}i=1,l=1norte,K,σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K){\displaystyle \propto \pi (\{y_{ij}\}_{i=1,j=1}^{N,M_{i}},\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})}

=π({yij}i=1,j=1norte,METROi|{θli}i=1,l=1norte,K,σ2)Etapa 1: Modelo a nivel individual×π({θli}i=1,l=1norte,K|{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K)Etapa 2: Modelo de población×pag(σ2,{αl}l=1K,{βlb}l=1,b=1K,PAG,{ωl}l=1K)Etapa 3: Previa{\displaystyle =\underbrace {\pi (\{y_{ij}\}_{i=1,j=1}^{N,M_{i}}|\{\theta _{li}\}_{i=1,l=1}^{N,K},\sigma ^{2})} _{\text{Stage 1: Individual-Level Model}}\times \underbrace {\pi (\{\theta _{li}\}_{i=1,l=1}^{N,K}|\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})} _{\text{Stage 2: Population Model}}\times \underbrace {p(\sigma ^{2},\{\alpha _{l}\}_{l=1}^{K},\{\beta _{lb}\}_{l=1,b=1}^{K,P},\{\omega _{l}\}_{l=1}^{K})} _{\text{Stage 3: Prior}}}

El panel de la derecha muestra el ciclo de investigación bayesiana utilizando el modelo bayesiano de efectos mixtos no lineales. [ 16 ] Un ciclo de investigación que utiliza el modelo bayesiano de efectos mixtos no lineales comprende dos pasos: (a) ciclo de investigación estándar y (b) flujo de trabajo específico bayesiano.

Un ciclo de investigación estándar implica 1) revisión de la literatura , 2) definición de un problema y 3) especificación de la pregunta de investigación y la hipótesis. El flujo de trabajo específico bayesiano estratifica este enfoque para incluir tres subpasos: (b)–(i) formalización de distribuciones previas basadas en el conocimiento previo y la obtención de información previa; (b)–(ii) determinación de la función de verosimilitud basada en una función no lineal.F{\displaystyle f}; y (b)–(iii) realizar una inferencia posterior. La inferencia posterior resultante puede utilizarse para iniciar un nuevo ciclo de investigación.

Aplicaciones

Los marcos bayesianos jerárquicos se han aplicado para modelar, por ejemplo, tareas de aprendizaje por refuerzo y toma de decisiones, [ 17 ] los efectos de la mutación de antígenos en el sistema inmunitario , [ 18 ] y procesos ecológicos que afectan la distribución de especies , [ 19 ] por mencionar algunos. PyMC es un paquete de Python de código abierto y flexible que admite este tipo de modelado. [ 20 ]

Referencias

  1. 1 2 Allenby, Rossi, McCulloch (enero de 2005). "Modelo bayesiano jerárquico: una guía práctica" . Journal of Bayesian Applications in Marketing , pp. 1–4. Recuperado el 26 de abril de 2014, p. 3
  2. Gelman, Andrew ; Carlin, John B.; Stern, Hal S. y Rubin, Donald B. (2004). Análisis de datos bayesianos (segunda  ed.). Boca Raton, Florida: CRC Press. págs. 4–5 . ISBN  1-58488-388-X.
  3. Lee, Se Yoon; Lei, Bowen; Mallick, Bani (2020). "Estimación de las curvas de propagación de COVID-19 integrando datos globales y tomando prestada información" . PLOS ONE . 15 (7) e0236860. arXiv : 2005.00662 . Bibcode : 2020PLoSO..1536860L . doi : 10.1371/journal.pone.0236860 . PMC 7390340. PMID 32726361 .  
  4. Lee, Se Yoon; Mallick, Bani (2021). "Modelado jerárquico bayesiano: aplicación a los resultados de producción en el esquisto Eagle Ford del sur de Texas" . Sankhya B. 84 : 1–43 . doi : 10.1007 /s13571-020-00245-8 .
  5. ^ Gelman y col. 2004 , pág. 6.
  6. ^ Gelman y cols. 2004 , pág. 117.
  7. ^ Bueno , IJ (1980). "Un poco de historia de la metodología bayesiana jerárquica" . Trabajos de Estadística y de Investigación Operativa . 31 : 489– 519. doi : 10.1007/BF02888365 . S2CID 121270218 . 
  8. Bernardo, Smith (1994). Teoría bayesiana . Chichester, Inglaterra: John Wiley & Sons, ISBN 0-471-92416-4pág. 23
  9. ^ Gelman y cols. 2004 , págs. 6–8.
  10. Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 167–168
  11. ^ Gelman y col. 2004 , págs. 121-125.
  12. 1 2 Diaconis, Freedman (1980). "Secuencias intercambiables finitas" . Anales de Probabilidad, págs. 745–747
  13. Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 371–372
  14. ^ Gelman y col. 2004 , págs. 120-121.
  15. 1 2 3 Box GEP , Tiao GC (1965). "Problema multiparamétrico desde un punto de vista bayesiano" . Problemas multiparamétricos desde un punto de vista bayesiano, volumen 36, número 5. Ciudad de Nueva York: John Wiley & Sons, ISBN 0-471-57428-7
  16. 1 2 Lee, Se Yoon (2022). "Modelos no lineales bayesianos para datos de mediciones repetidas: una descripción general, implementación y aplicaciones" . Matemáticas . 10 (6): 898. arXiv : 2201.12430 . doi : 10.3390/math10060898 .
  17. Ahn, Woo-Young; Haines, Nathaniel; Zhang, Lei (2017-10-01). "Revelando los mecanismos neurocomputacionales del aprendizaje por refuerzo y la toma de decisiones con el paquete hBayesDM" . Psiquiatría Computacional . 1 : 24. doi : 10.1162/CPSY_a_00002 . ISSN 2379-6227 . PMC 5869013. PMID 29601060 .   
  18. Banerjee, Amitava; Pattinson, David J.; Wincek, Cornelia L.; Bunk, Paul; Axhemi, Armend; Chapin, Sarah R.; Navlakha, Saket; Meyer, Hannah V. (2025-07-25). " Predicción de la reactividad cruzada del receptor de células T mejorada mediante una base de datos de escaneo mutacional integral" . Cell Systems . 0. doi : 10.1016/j.cels.2025.101345 . ISSN 2405-4712 . PMID 40713946 .  
  19. Gelfand, Alan E.; Holder, Mark; Latimer, Andrew; Lewis, Paul O.; Rebelo, Anthony G.; Silander, John A.; Wu, Shanshan (2006-03-01). "Explicación de los patrones de distribución de especies mediante modelado jerárquico". Bayesian Analysis . 1 (1). doi : 10.1214/06-ba102 . hdl : 1808/9215 . ISSN 1936-0975 . 
  20. Abril-Pla, Oriol; Andreani, Virgilio; Carroll, Colin; Dong, Larry; Fonnesbeck, Christopher J.; Kochúrov, Maxim; Kumar, Ravin; Laosiano, Junpeng; Luhmann, Christian C.; Martín, Osvaldo A.; Osthege, Michael; Vieira, Ricardo; Wiecki, Thomas; Zinkov, Robert (1 de septiembre de 2023). "PyMC: un marco de programación probabilística moderno y completo en Python" . PeerJ Ciencias de la Computación . 9 e1516. doi : 10.7717/peerj-cs.1516 . ISSN 2376-5992 . PMC 10495961 . PMID 37705656 .