El modelado jerárquico bayesiano es un modelo estadístico escrito en múltiples niveles (forma jerárquica) que estima la distribución posterior de los parámetros del modelo mediante el método bayesiano . [ 1 ] Los submodelos se combinan para formar el modelo jerárquico, y el teorema de Bayes se utiliza para integrarlos con los datos observados y tener en cuenta toda la incertidumbre presente. Esta integración permite calcular la distribución posterior actualizada sobre los (hiper)parámetros, actualizando así las creencias previas a la luz de los datos observados.
La estadística frecuentista puede arrojar conclusiones aparentemente incompatibles con las ofrecidas por la estadística bayesiana debido al tratamiento bayesiano de los parámetros como variables aleatorias y su uso de información subjetiva para establecer supuestos sobre estos parámetros. [ 2 ] Dado que los enfoques responden a preguntas diferentes, los resultados formales no son técnicamente contradictorios, pero ambos enfoques discrepan sobre qué respuesta es relevante para aplicaciones particulares. Los bayesianos argumentan que la información relevante sobre la toma de decisiones y la actualización de creencias no puede ignorarse y que el modelado jerárquico tiene el potencial de superar los métodos clásicos en aplicaciones donde los encuestados proporcionan múltiples datos de observación. Además, el modelo ha demostrado ser robusto , con la distribución posterior menos sensible a las distribuciones previas jerárquicas más flexibles.
El modelado jerárquico, como su nombre lo indica, conserva una estructura de datos anidada y se utiliza cuando la información está disponible en varios niveles diferentes de unidades de observación. Por ejemplo, en el modelado epidemiológico para describir las trayectorias de infección en varios países, las unidades de observación son los países, y cada país tiene su propio perfil temporal de casos diarios infectados. [ 3 ] En el análisis de curvas de declive para describir la curva de declive de la producción de petróleo o gas en múltiples pozos, las unidades de observación son los pozos de petróleo o gas en una región de yacimiento, y cada pozo tiene su propio perfil temporal de tasas de producción de petróleo o gas (generalmente, barriles por mes). [ 4 ] El modelado jerárquico se utiliza para diseñar estrategias basadas en cálculos para problemas multiparamétricos. [ 5 ]
Filosofía
Los métodos y modelos estadísticos suelen involucrar múltiples parámetros que pueden considerarse relacionados o conectados de tal manera que el problema implica una dependencia del modelo de probabilidad conjunta para estos parámetros. [ 6 ] Los grados individuales de creencia, expresados en forma de probabilidades, conllevan incertidumbre. [ 7 ] En medio de esto está el cambio de los grados de creencia a lo largo del tiempo. Como afirmaron el profesor José M. Bernardo y el profesor Adrian F. Smith , "La realidad del proceso de aprendizaje consiste en la evolución de las creencias individuales y subjetivas sobre la realidad". Estas probabilidades subjetivas están más directamente involucradas en la mente que las probabilidades físicas. [ 7 ] Por lo tanto, es con esta necesidad de actualizar las creencias que los bayesianos han formulado un modelo estadístico alternativo que toma en cuenta la ocurrencia previa de un evento particular. [ 8 ]
Teorema de Bayes
La supuesta ocurrencia de un evento del mundo real generalmente modificará las preferencias entre ciertas opciones. Esto se logra modificando el grado de creencia que un individuo asocia a los eventos que definen las opciones. [ 9 ]
Supongamos que en un estudio sobre la efectividad de los tratamientos cardíacos, los pacientes del hospital j tienen una probabilidad de supervivencia, la probabilidad de supervivencia se actualizará con la ocurrencia de y , el evento en el que se crea un suero controvertido que, según algunos, aumenta la supervivencia en pacientes cardíacos.
Para hacer afirmaciones de probabilidad actualizadas sobre, dada la ocurrencia del evento y , debemos comenzar con un modelo que proporcione una distribución de probabilidad conjunta paray y . Esto se puede escribir como un producto de las dos distribuciones que a menudo se denominan distribución a priori.y la distribución del muestreorespectivamente:
Utilizando la propiedad básica de la probabilidad condicional , la distribución posterior dará como resultado:
Esta ecuación, que muestra la relación entre la probabilidad condicional y los eventos individuales, se conoce como el teorema de Bayes. Esta expresión simple encapsula el núcleo técnico de la inferencia bayesiana que tiene como objetivo deconstruir la probabilidad,, en relación con los subconjuntos resolubles de su evidencia de apoyo. [ 9 ]
Intercambiabilidad
El punto de partida habitual de un análisis estadístico es la suposición de que los valores nson intercambiables. Si no hay información, aparte de los datos y , disponible para distinguir alguno de losDado que no se puede ordenar ni agrupar ningún parámetro, se debe asumir la simetría de los parámetros de la distribución previa. [ 10 ] Esta simetría se representa probabilísticamente mediante la intercambiabilidad. Generalmente, es útil y apropiado modelar los datos de una distribución intercambiable como independientes e idénticamente distribuidos , dado algún vector de parámetros desconocido ., con distribución.
Intercambiabilidad finita
Para un número fijo n , el conjunto es intercambiable si la probabilidad conjuntaes invariante bajo permutaciones de los índices. Es decir, para cada permutacióno de (1, 2, …, n ),[ 11 ]
El siguiente es un ejemplo intercambiable, pero no independiente e idéntico (iid): Considere una urna con una bola roja y una bola azul en su interior, con probabilidadde sacar cualquiera de las dos. Las bolas se sacan sin reemplazo, es decir, después de que se saca una bola de labolas, habráBolas restantes para el próximo sorteo.
La probabilidad de seleccionar una bola roja en el primer sorteo y una bola azul en el segundo es igual a la probabilidad de seleccionar una bola azul en el primer sorteo y una roja en el segundo, ambas iguales a 1/2:
- .
Esto hace queycambiable.
Pero la probabilidad de seleccionar una bola roja en el segundo sorteo, dado que la bola roja ya fue seleccionada en el primero, es 0. Esto no es igual a la probabilidad de que la bola roja sea seleccionada en el segundo sorteo, que es 1/2:
- .
De este modo,yno son independientes.
SiSi son independientes e idénticamente distribuidas, entonces son intercambiables, pero lo contrario no es necesariamente cierto. [ 12 ]
Intercambiabilidad infinita
La intercambiabilidad infinita es la propiedad de que todo subconjunto finito de una secuencia infinita,es intercambiable. Para cualquier n , la secuenciaes intercambiable. [ 12 ]
Modelos jerárquicos
Componentes
El modelado jerárquico bayesiano utiliza dos conceptos importantes para derivar la distribución posterior, [ 1 ] a saber:
- Hiperparámetros : parámetros de la distribución a priori
- Hiperpriores : distribuciones de hiperparámetros
Supongamos que una variable aleatoria Y sigue una distribución normal con parámetrocomo la media y 1 como la varianza , es decirLa relación de la tildepuede leerse como "tiene la distribución de" o "se distribuye como". Supongamos también que el parámetrotiene una distribución dada por una distribución normal con mediay varianza 1, es decir. Además,sigue otra distribución dada, por ejemplo, por la distribución normal estándar ,. El parámetrose denomina hiperparámetro, mientras que su distribución viene dada pores un ejemplo de una distribución hiperprior. La notación de la distribución de Y cambia a medida que se agrega otro parámetro, es decir. Si hay otra etapa, por ejemplo,siguiendo otra distribución normal con una media dey una variación de, entonces,yTambién se les puede llamar hiperparámetros con distribuciones hiperprior. [ 6 ]
Estructura
Dejarser una observación yun parámetro que rige el proceso de generación de datos paraSupongamos además que los parámetrosse generan de forma intercambiable a partir de una población común, con una distribución regida por un hiperparámetroEl modelo jerárquico bayesiano consta de las siguientes etapas :
La probabilidad, como se observa en la etapa I es, concomo su distribución previa. Tenga en cuenta que la probabilidad depende desolo a través de.
La distribución previa de la etapa I se puede desglosar en:
- [de la definición de probabilidad condicional]
Concomo su hiperparámetro con distribución hiperprior,.
Por lo tanto, la distribución posterior es proporcional a:
- [utilizando el teorema de Bayes]
- [ 13 ]
Ejemplo de cálculo
Por ejemplo, un profesor quiere estimar el rendimiento de un estudiante en el SAT . El profesor utiliza el promedio de calificaciones actual (GPA) del estudiante para realizar la estimación. Su GPA actual, denotado por, tiene una probabilidad dada por alguna función de probabilidad con parámetro, es decirEste parámetroes la puntuación SAT del estudiante. La puntuación SAT se considera una muestra proveniente de una distribución de población común indexada por otro parámetro., que es el grado de la escuela secundaria del estudiante (primer año, segundo año, tercer año o cuarto año). [ 14 ] Es decir,. Además, el hiperparámetrosigue su propia distribución dada por, un hiperprior.
Estas relaciones pueden utilizarse para calcular la probabilidad de obtener una puntuación específica en el SAT en relación con un promedio de calificaciones determinado:
Toda la información del problema se utilizará para calcular la distribución posterior. En lugar de resolverlo únicamente utilizando la distribución previa y la función de verosimilitud , el uso de hiperpriores permite una distinción más precisa de las relaciones entre las variables dadas. [ 15 ]
modelo jerárquico de 2 etapas
En general, la distribución posterior conjunta de interés en los modelos jerárquicos de dos etapas es:
Modelo jerárquico de 3 etapas
Para los modelos jerárquicos de 3 etapas, la distribución posterior viene dada por:
Modelo bayesiano no lineal de efectos mixtos

Se podría utilizar una versión de tres etapas del modelado jerárquico bayesiano para calcular la probabilidad en 1) un nivel individual, 2) a nivel de población y 3) la distribución a priori, que es una distribución de probabilidad supuesta que tiene lugar antes de que se adquiera la evidencia inicial:
Etapa 1: Modelo a nivel individual
Etapa 2: Modelo de población
Etapa 3: Previa
Aquí,denota la respuesta continua de la-ésimo sujeto en el momento, yes el-ésima covariable de la-ésimo sujeto. Los parámetros involucrados en el modelo están escritos en letras griegas. La variablees una función conocida parametrizada por lavector de -dimensiones.
Típicamente,es una función "no lineal" y describe la trayectoria temporal de los individuos. En el modelo,y describen la variabilidad intraindividual y la variabilidad interindividual, respectivamente. Si no se considera la distribución a priori, la relación se reduce a un modelo frecuentista no lineal de efectos mixtos.
Una tarea central en la aplicación de los modelos bayesianos no lineales de efectos mixtos es evaluar la densidad posterior:
El panel de la derecha muestra el ciclo de investigación bayesiana utilizando el modelo bayesiano de efectos mixtos no lineales. [ 16 ] Un ciclo de investigación que utiliza el modelo bayesiano de efectos mixtos no lineales comprende dos pasos: (a) ciclo de investigación estándar y (b) flujo de trabajo específico bayesiano.
Un ciclo de investigación estándar implica 1) revisión de la literatura , 2) definición de un problema y 3) especificación de la pregunta de investigación y la hipótesis. El flujo de trabajo específico bayesiano estratifica este enfoque para incluir tres subpasos: (b)–(i) formalización de distribuciones previas basadas en el conocimiento previo y la obtención de información previa; (b)–(ii) determinación de la función de verosimilitud basada en una función no lineal.; y (b)–(iii) realizar una inferencia posterior. La inferencia posterior resultante puede utilizarse para iniciar un nuevo ciclo de investigación.
Aplicaciones
Los marcos bayesianos jerárquicos se han aplicado para modelar, por ejemplo, tareas de aprendizaje por refuerzo y toma de decisiones, [ 17 ] los efectos de la mutación de antígenos en el sistema inmunitario , [ 18 ] y procesos ecológicos que afectan la distribución de especies , [ 19 ] por mencionar algunos. PyMC es un paquete de Python de código abierto y flexible que admite este tipo de modelado. [ 20 ]
Referencias
- 1 2 Allenby, Rossi, McCulloch (enero de 2005). "Modelo bayesiano jerárquico: una guía práctica" . Journal of Bayesian Applications in Marketing , pp. 1–4. Recuperado el 26 de abril de 2014, p. 3
- ↑ Gelman, Andrew ; Carlin, John B.; Stern, Hal S. y Rubin, Donald B. (2004). Análisis de datos bayesianos (segunda ed.). Boca Raton, Florida: CRC Press. págs. 4–5 . ISBN 1-58488-388-X.
- ↑ Lee, Se Yoon; Lei, Bowen; Mallick, Bani (2020). "Estimación de las curvas de propagación de COVID-19 integrando datos globales y tomando prestada información" . PLOS ONE . 15 (7) e0236860. arXiv : 2005.00662 . Bibcode : 2020PLoSO..1536860L . doi : 10.1371/journal.pone.0236860 . PMC 7390340. PMID 32726361 .
- ↑ Lee, Se Yoon; Mallick, Bani (2021). "Modelado jerárquico bayesiano: aplicación a los resultados de producción en el esquisto Eagle Ford del sur de Texas" . Sankhya B. 84 : 1–43 . doi : 10.1007 /s13571-020-00245-8 .
- ^ Gelman y col. 2004 , pág. 6.
- ^ Gelman y cols. 2004 , pág. 117.
- ^ Bueno , IJ (1980). "Un poco de historia de la metodología bayesiana jerárquica" . Trabajos de Estadística y de Investigación Operativa . 31 : 489– 519. doi : 10.1007/BF02888365 . S2CID 121270218 .
- ↑ Bernardo, Smith (1994). Teoría bayesiana . Chichester, Inglaterra: John Wiley & Sons, ISBN 0-471-92416-4pág. 23
- ^ Gelman y cols. 2004 , págs. 6–8.
- ↑ Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 167–168
- ^ Gelman y col. 2004 , págs. 121-125.
- 1 2 Diaconis, Freedman (1980). "Secuencias intercambiables finitas" . Anales de Probabilidad, págs. 745–747
- ↑ Bernardo, Degroot, Lindley (septiembre de 1983). «Actas de la Segunda Reunión Internacional de Valencia» . Bayesian Statistics 2. Ámsterdam: Elsevier Science Publishers BV, ISBN 0-444-87746-0págs. 371–372
- ^ Gelman y col. 2004 , págs. 120-121.
- 1 2 3 Box GEP , Tiao GC (1965). "Problema multiparamétrico desde un punto de vista bayesiano" . Problemas multiparamétricos desde un punto de vista bayesiano, volumen 36, número 5. Ciudad de Nueva York: John Wiley & Sons, ISBN 0-471-57428-7
- 1 2 Lee, Se Yoon (2022). "Modelos no lineales bayesianos para datos de mediciones repetidas: una descripción general, implementación y aplicaciones" . Matemáticas . 10 (6): 898. arXiv : 2201.12430 . doi : 10.3390/math10060898 .
- ↑ Ahn, Woo-Young; Haines, Nathaniel; Zhang, Lei (2017-10-01). "Revelando los mecanismos neurocomputacionales del aprendizaje por refuerzo y la toma de decisiones con el paquete hBayesDM" . Psiquiatría Computacional . 1 : 24. doi : 10.1162/CPSY_a_00002 . ISSN 2379-6227 . PMC 5869013. PMID 29601060 .
- ↑ Banerjee, Amitava; Pattinson, David J.; Wincek, Cornelia L.; Bunk, Paul; Axhemi, Armend; Chapin, Sarah R.; Navlakha, Saket; Meyer, Hannah V. (2025-07-25). " Predicción de la reactividad cruzada del receptor de células T mejorada mediante una base de datos de escaneo mutacional integral" . Cell Systems . 0. doi : 10.1016/j.cels.2025.101345 . ISSN 2405-4712 . PMID 40713946 .
- ↑ Gelfand, Alan E.; Holder, Mark; Latimer, Andrew; Lewis, Paul O.; Rebelo, Anthony G.; Silander, John A.; Wu, Shanshan (2006-03-01). "Explicación de los patrones de distribución de especies mediante modelado jerárquico". Bayesian Analysis . 1 (1). doi : 10.1214/06-ba102 . hdl : 1808/9215 . ISSN 1936-0975 .
- ↑ Abril-Pla, Oriol; Andreani, Virgilio; Carroll, Colin; Dong, Larry; Fonnesbeck, Christopher J.; Kochúrov, Maxim; Kumar, Ravin; Laosiano, Junpeng; Luhmann, Christian C.; Martín, Osvaldo A.; Osthege, Michael; Vieira, Ricardo; Wiecki, Thomas; Zinkov, Robert (1 de septiembre de 2023). "PyMC: un marco de programación probabilística moderno y completo en Python" . PeerJ Ciencias de la Computación . 9 e1516. doi : 10.7717/peerj-cs.1516 . ISSN 2376-5992 . PMC 10495961 . PMID 37705656 .
- redes bayesianas