Los métodos bayesianos variacionales son una familia de técnicas para aproximar integrales intratables que surgen en la inferencia bayesiana y el aprendizaje automático . Se utilizan típicamente en modelos estadísticos complejos que constan de variables observadas (generalmente denominadas "datos"), así como parámetros desconocidos y variables latentes , con diversos tipos de relaciones entre los tres tipos de variables aleatorias , como podría describirse mediante un modelo gráfico . Como es típico en la inferencia bayesiana, los parámetros y las variables latentes se agrupan como "variables no observadas". Los métodos bayesianos variacionales se utilizan principalmente para dos propósitos:
- Proporcionar una aproximación analítica a la probabilidad posterior de las variables no observadas, con el fin de realizar inferencias estadísticas sobre estas variables.
- Para obtener una cota inferior para la verosimilitud marginal (a veces denominada evidencia ) de los datos observados (es decir, la probabilidad marginal de los datos dado el modelo, con marginalización aplicada a las variables no observadas). Esto se utiliza habitualmente para la selección de modelos , partiendo de la idea general de que una mayor verosimilitud marginal para un modelo dado indica un mejor ajuste de los datos por parte de dicho modelo y, por lo tanto, una mayor probabilidad de que el modelo en cuestión sea el que generó los datos. (Véase también el artículo sobre el factor de Bayes ).
En el primer propósito (el de aproximar una probabilidad posterior), el método bayesiano variacional es una alternativa a los métodos de muestreo de Monte Carlo —en particular, a los métodos de Monte Carlo de cadena de Markov como el muestreo de Gibbs— para adoptar un enfoque completamente bayesiano en la inferencia estadística sobre distribuciones complejas que son difíciles de evaluar o muestrear directamente . En concreto, mientras que las técnicas de Monte Carlo proporcionan una aproximación numérica a la probabilidad posterior exacta mediante un conjunto de muestras, el método bayesiano variacional proporciona una solución analítica exacta y localmente óptima para una aproximación de la probabilidad posterior.
El método bayesiano variacional puede considerarse una extensión del algoritmo de expectativa-maximización (EM), que va desde la estimación de máxima verosimilitud (ML) o máxima probabilidad a posteriori (MAP) del valor más probable de cada parámetro hasta la estimación bayesiana completa, la cual calcula (una aproximación a) la distribución posterior completa de los parámetros y las variables latentes. Al igual que en EM, encuentra un conjunto de valores óptimos para los parámetros y presenta la misma estructura alternante, basada en un conjunto de ecuaciones interrelacionadas (mutuamente dependientes) que no pueden resolverse analíticamente.
Para muchas aplicaciones, el método bayesiano variacional produce soluciones con una precisión comparable a la del muestreo de Gibbs, pero a mayor velocidad. Sin embargo, derivar el conjunto de ecuaciones utilizadas para actualizar los parámetros iterativamente suele requerir mucho más trabajo que derivar las ecuaciones de muestreo de Gibbs. Esto ocurre incluso con muchos modelos conceptualmente sencillos, como se demuestra a continuación en el caso de un modelo básico no jerárquico con solo dos parámetros y sin variables latentes.
Derivación matemática
Problema
En la inferencia variacional , la distribución posterior sobre un conjunto de variables no observadasdados algunos datosse aproxima mediante una denominada distribución variacional ,
La distribuciónestá restringido a pertenecer a una familia de distribuciones de forma más simple que(por ejemplo, una familia de distribuciones gaussianas), seleccionadas con la intención de hacersimilar a la verdadera posterior,.
La similitud (o disimilitud) se mide en términos de una función de disimilitud.y por lo tanto la inferencia se realiza seleccionando la distribuciónque minimiza.
divergencia KL
El tipo más común de Bayes variacional utiliza la divergencia de Kullback-Leibler (divergencia KL) de Q con respecto a P como función de disimilitud. Esta elección hace que esta minimización sea manejable. La divergencia KL se define como
Nótese que Q y P están invertidos respecto a lo que cabría esperar. Este uso de la divergencia KL invertida es conceptualmente similar al algoritmo de maximización de la expectativa . (Utilizar la divergencia KL en sentido contrario produce el algoritmo de propagación de la expectativa ).
Dificultad
Las técnicas variacionales se utilizan normalmente para formar una aproximación para:
La marginación sobrecalcularen el denominador suele ser intratable, porque, por ejemplo, el espacio de búsqueda dees combinatoriamente grande. Por lo tanto, buscamos una aproximación, utilizando.
Límite inferior de la evidencia
Dado que, la divergencia KL anterior también se puede escribir como
Porquees una constante con respecto ayporquees una distribución, tenemos
que, según la definición de valor esperado (para una variable aleatoria discreta ), puede escribirse de la siguiente manera:
que se puede reorganizar para convertirse en
Como evidencia del registroestá fijo con respecto a, maximizando el término finalminimiza la divergencia KL dede. Mediante la elección apropiada de,se vuelve manejable para calcular y maximizar. Por lo tanto, tenemos una aproximación analítica.para la parte posteriory un límite inferiorpara la evidencia del registro(dado que la divergencia KL no es negativa).
El límite inferiorse conoce como energía libre variacional (negativa) por analogía con la energía libre termodinámica porque también puede expresarse como una energía negativamás la entropía de. El términoTambién se conoce como Límite Inferior de Evidencia , abreviado como ELBO , para enfatizar que es un límite inferior (en el peor de los casos) de la evidencia logarítmica de los datos.
Pruebas
Mediante el teorema pitagórico generalizado de la divergencia de Bregman , del cual la divergencia KL es un caso especial, se puede demostrar que: [ 1 ] [ 2 ]

dónde es un conjunto convexo y la igualdad se cumple si:
En este caso, el minimizador globalconse puede encontrar de la siguiente manera: [ 1 ]
en la que la constante de normalización es:
El términoEn la práctica, a menudo se le llama límite inferior de la evidencia ( ELBO ), ya que, [ 1 ] como se muestra arriba.
Al intercambiar los roles deypodemos calcular iterativamente el aproximadoyde los marginales del modelo verdaderoyrespectivamente. Aunque este esquema iterativo tiene garantizada la convergencia monótona, [ 1 ] la convergenciaes solo un minimizador local de.
Si el espacio restringidoestá confinado dentro de un espacio independiente, es decirEl esquema iterativo anterior se convertirá en la denominada aproximación de campo medio.como se muestra a continuación.
Aproximación de campo medio
La distribución variacionalPor lo general, se supone que se factoriza sobre alguna partición de las variables latentes, es decir, para alguna partición de las variables latentes.en,
Se puede demostrar utilizando el cálculo de variaciones (de ahí el nombre "Bayes variacional") que la distribución "óptima"para cada uno de los factores(en términos de la distribución que minimiza la divergencia KL, como se describió anteriormente) satisface: [ 3 ]
dónde is the expectation of the logarithm of the joint probability of the data and latent variables, taken with respect to over all variables not in the partition: refer to Lemma 4.1 of[4] for a derivation of the distribution .
In practice, we usually work in terms of logarithms, i.e.:
The constant in the above expression is related to the normalizing constant (the denominator in the expression above for ) and is usually reinstated by inspection, as the rest of the expression can usually be recognized as being a known type of distribution (e.g. Gaussian, gamma, etc.).
Using the properties of expectations, the expression can usually be simplified into a function of the fixed hyperparameters of the prior distributions over the latent variables and of expectations (and sometimes higher moments such as the variance) of latent variables not in the current partition (i.e. latent variables not included in ). This creates circular dependencies between the parameters of the distributions over variables in one partition and the expectations of variables in the other partitions. This naturally suggests an iterative algorithm, much like EM (the expectation–maximization algorithm), in which the expectations (and possibly higher moments) of the latent variables are initialized in some fashion (perhaps randomly), and then the parameters of each distribution are computed in turn using the current values of the expectations, after which the expectation of the newly computed distribution is set appropriately according to the computed parameters. An algorithm of this sort is guaranteed to converge.[5]
En otras palabras, para cada partición de variables, al simplificar la expresión de la distribución sobre las variables de la partición y examinar la dependencia funcional de la distribución con respecto a las variables en cuestión, generalmente se puede determinar la familia de la distribución (lo que a su vez determina el valor de la constante). La fórmula para los parámetros de la distribución se expresará en términos de los hiperparámetros de las distribuciones previas (que son constantes conocidas), pero también en términos de las esperanzas de funciones de variables en otras particiones. Por lo general, estas esperanzas se pueden simplificar en funciones de las esperanzas de las propias variables (es decir, las medias ); a veces también aparecen las esperanzas de variables al cuadrado (que pueden estar relacionadas con la varianza de las variables) o las esperanzas de potencias superiores (es decir, momentos superiores ). En la mayoría de los casos, las distribuciones de las otras variables pertenecerán a familias conocidas, y se pueden consultar las fórmulas para las esperanzas relevantes. Sin embargo, esas fórmulas dependen de los parámetros de esas distribuciones, que a su vez dependen de las esperanzas sobre otras variables. El resultado es que las fórmulas para los parámetros de las distribuciones de cada variable pueden expresarse como una serie de ecuaciones con dependencias mutuas no lineales entre las variables. Por lo general, no es posible resolver este sistema de ecuaciones directamente. Sin embargo, como se describió anteriormente, las dependencias sugieren un algoritmo iterativo sencillo que, en la mayoría de los casos, garantiza la convergencia. Un ejemplo aclarará este proceso.
Una fórmula de dualidad para la inferencia variacional

El siguiente teorema se conoce como fórmula de dualidad para la inferencia variacional. [ 4 ] Explica algunas propiedades importantes de las distribuciones variacionales utilizadas en los métodos bayesianos variacionales.
Teorema Consideremos dos espacios de probabilidadyconSupongamos que existe una medida de probabilidad dominante común.de tal manera quey. Dejardenota cualquier variable aleatoria de valor real enque satisfaceEntonces se cumple la siguiente igualdad.
Además, el supremo del lado derecho se alcanza si y solo si se cumple
casi con seguridad con respecto a la medida de probabilidad, dóndeydenotan las derivadas de Radon-Nikodym de las medidas de probabilidadycon respecto a, respectivamente.
Un ejemplo básico
Consideremos un modelo bayesiano simple no jerárquico que consiste en un conjunto de observaciones i.i.d. de una distribución gaussiana , con media y varianza desconocidas . [ 6 ] A continuación, analizamos este modelo en detalle para ilustrar el funcionamiento del método bayesiano variacional.
Para mayor comodidad matemática, en el siguiente ejemplo trabajamos con la precisión —es decir, el recíproco de la varianza (o, en una distribución gaussiana multivariada, la inversa de la matriz de covarianza )— en lugar de con la varianza misma. (Desde un punto de vista teórico, la precisión y la varianza son equivalentes, ya que existe una correspondencia biunívoca entre ambas).
El modelo matemático
Colocamos distribuciones previas conjugadas sobre la media desconocida.y precisión, es decir, la media también sigue una distribución gaussiana, mientras que la precisión sigue una distribución gamma . En otras palabras:
Los hiperparámetrosyen las distribuciones previas son valores fijos y dados. Se pueden establecer en números positivos pequeños para dar distribuciones previas amplias que indiquen ignorancia sobre las distribuciones previas dey.
Se nos dapuntos de datosy nuestro objetivo es inferir la distribución posteriorde los parámetrosy
La probabilidad conjunta
La probabilidad conjunta de todas las variables se puede reescribir como
donde los factores individuales son
dónde
aproximación factorizada
Supongamos que, es decir, que la distribución posterior se factoriza en factores independientes parayEste tipo de suposición subyace al método bayesiano variacional. La verdadera distribución posterior no se comporta de esta manera (de hecho, en este caso sencillo, se sabe que es una distribución gaussiana-gamma ), por lo que el resultado que obtenemos será una aproximación.
Derivación de q ( μ )
Entonces
En la derivación anterior,,yreferirse a valores que son constantes con respecto a. Tenga en cuenta que el términono es una función dey tendrá el mismo valor independientemente del valor dePor lo tanto, en la línea 3 podemos absorberlo en el término constante al final. Hacemos lo mismo en la línea 7.
La última línea es simplemente un polinomio cuadrático enDado que este es el logaritmo de, podemos ver queen sí misma es una distribución gaussiana .
Con una cierta cantidad de matemáticas tediosas (expandir los cuadrados dentro de las llaves, separar y agrupar los términos que involucranyy completando el cuadrado sobre), podemos derivar los parámetros de la distribución gaussiana:
Tenga en cuenta que todos los pasos anteriores se pueden acortar utilizando la fórmula para la suma de dos ecuaciones cuadráticas .
En otras palabras:
Derivación de q( τ )
La derivación deEs similar a lo anterior, aunque omitimos algunos detalles en aras de la brevedad.
Al exponenciar ambos lados, podemos ver quees una distribución gamma . Específicamente:
Algoritmo para el cálculo de los parámetros
Recapitulemos las conclusiones de las secciones anteriores:
y
En cada caso, los parámetros de la distribución de una de las variables dependen de las esperanzas calculadas con respecto a la otra variable. Podemos desarrollar las esperanzas utilizando las fórmulas estándar para las esperanzas de los momentos de las distribuciones gaussiana y gamma:
Aplicar estas fórmulas a las ecuaciones anteriores es trivial en la mayoría de los casos, pero la ecuación pararequiere más trabajo:
Podemos entonces escribir las ecuaciones de los parámetros de la siguiente manera, sin ninguna expectativa:
Tenga en cuenta que existen dependencias circulares entre las fórmulas parayEsto sugiere naturalmente un algoritmo similar al EM :
- CalcularyUtilice estos valores para calculary
- Inicializara algún valor arbitrario.
- Utilice el valor actual dejunto con los valores conocidos de los otros parámetros, para calcular.
- Utilice el valor actual dejunto con los valores conocidos de los otros parámetros, para calcular.
- Repita los dos últimos pasos hasta la convergencia (es decir, hasta que ninguno de los valores haya cambiado más que una pequeña cantidad).
Entonces tenemos valores para los hiperparámetros de las distribuciones aproximadas de los parámetros posteriores, que podemos usar para calcular cualquier propiedad que queramos de la distribución posterior, por ejemplo, su media y varianza, una región de máxima densidad del 95 % (el intervalo más pequeño que incluye el 95 % de la probabilidad total), etc.
Se puede demostrar que este algoritmo garantiza la convergencia a un máximo local.
Cabe destacar también que las distribuciones posteriores tienen la misma forma que las distribuciones previas correspondientes. No partimos de esta premisa; la única suposición que hicimos fue que las distribuciones se factorizaban, y la forma de las distribuciones se derivó de forma natural. Resulta (véase más adelante) que el hecho de que las distribuciones posteriores tengan la misma forma que las distribuciones previas no es una coincidencia, sino un resultado general siempre que las distribuciones previas pertenezcan a la familia exponencial , lo cual ocurre con la mayoría de las distribuciones estándar.
Discusión adicional
Receta paso a paso
El ejemplo anterior muestra el método mediante el cual se deriva la aproximación variacional-bayesiana a una densidad de probabilidad posterior en una red bayesiana dada:
- Describe la red con un modelo gráfico , identificando las variables observadas (datos).y variables no observadas ( parámetros)y variables latentes) y sus distribuciones de probabilidad condicionales . El método bayesiano variacional construirá entonces una aproximación a la probabilidad posterior.La aproximación tiene la propiedad básica de ser una distribución factorizada, es decir, un producto de dos o más distribuciones independientes sobre subconjuntos disjuntos de las variables no observadas.
- Divida las variables no observadas en dos o más subconjuntos, sobre los cuales se derivarán los factores independientes. No existe un procedimiento universal para hacer esto; crear demasiados subconjuntos produce una aproximación deficiente, mientras que crear muy pocos hace que todo el procedimiento variacional bayesiano sea intratable. Normalmente, la primera división consiste en separar los parámetros y las variables latentes; a menudo, esto es suficiente por sí solo para producir un resultado manejable. Supongamos que las particiones se llaman.
- Para una partición dadaEscribe la fórmula para la distribución que mejor se aproxime.utilizando la ecuación básica.
- Complete la fórmula para la distribución de probabilidad conjunta utilizando el modelo gráfico. Cualquier distribución condicional de componentes que no involucre ninguna de las variables enpueden ignorarse; se incorporarán al término constante.
- Simplifica la fórmula y aplica el operador de expectativa, siguiendo el ejemplo anterior. Idealmente, esto debería simplificarse en expectativas de funciones básicas de variables que no están en(p. ej., primeros o segundos momentos brutos , esperanza de un logaritmo, etc.). Para que el procedimiento variacional bayesiano funcione correctamente, estas esperanzas deben poder expresarse analíticamente como funciones de los parámetros y/o hiperparámetros de las distribuciones de estas variables. En todos los casos, estos términos de esperanza son constantes con respecto a las variables en la partición actual.
- La forma funcional de la fórmula con respecto a las variables en la partición actual indica el tipo de distribución. En particular, al exponenciar la fórmula se obtiene la función de densidad de probabilidad (FDP) de la distribución (o al menos, una proporcional a ella, con una constante de normalización desconocida ). Para que el método sea viable, debe ser posible reconocer la forma funcional como perteneciente a una distribución conocida. Puede requerirse una manipulación matemática significativa para convertir la fórmula en una forma que coincida con la FDP de una distribución conocida. Cuando esto se logra, la constante de normalización puede restablecerse por definición, y las ecuaciones para los parámetros de la distribución conocida pueden derivarse extrayendo las partes apropiadas de la fórmula.
- Cuando todas las expectativas pueden reemplazarse analíticamente con funciones de variables que no están en la partición actual, y la función de densidad de probabilidad (PDF) se expresa en una forma que permite su identificación con una distribución conocida, el resultado es un conjunto de ecuaciones que expresan los valores de los parámetros óptimos como funciones de los parámetros de las variables en otras particiones.
- Cuando este procedimiento se puede aplicar a todas las particiones, el resultado es un conjunto de ecuaciones interrelacionadas que especifican los valores óptimos de todos los parámetros.
- A continuación, se aplica un procedimiento de maximización de la esperanza (EM), seleccionando un valor inicial para cada parámetro y recorriendo una serie de pasos. En cada paso, se actualizan las ecuaciones, modificando cada parámetro sucesivamente. Se garantiza la convergencia.
Puntos más importantes
Debido a todas las manipulaciones matemáticas involucradas, es fácil perder de vista el panorama general. Lo importante es:
- La idea del método bayesiano variacional es construir una aproximación analítica a la probabilidad posterior del conjunto de variables no observadas (parámetros y variables latentes), dados los datos. Esto significa que la forma de la solución es similar a otros métodos de inferencia bayesiana , como el muestreo de Gibbs , es decir, una distribución que busca describir todo lo que se sabe sobre las variables. Al igual que en otros métodos bayesianos, pero a diferencia, por ejemplo, del algoritmo de expectativa-maximización (EM) u otros métodos de máxima verosimilitud , ambos tipos de variables no observadas (parámetros y variables latentes) se tratan de la misma manera, es decir, como variables aleatorias . Las estimaciones para las variables se pueden obtener mediante los métodos bayesianos estándar, por ejemplo, calculando la media de la distribución para obtener una estimación puntual o derivando un intervalo creíble , una región de máxima densidad, etc.
- La "aproximación analítica" significa que se puede escribir una fórmula para la distribución posterior. La fórmula generalmente consiste en un producto de distribuciones de probabilidad bien conocidas, cada una de las cuales se factoriza sobre un conjunto de variables no observadas (es decir, es condicionalmente independiente de las otras variables, dados los datos observados). Esta fórmula no es la verdadera distribución posterior, sino una aproximación a ella; en particular, generalmente coincidirá bastante bien en los momentos de menor orden de las variables no observadas, por ejemplo, la media y la varianza .
- El resultado de todas las manipulaciones matemáticas es (1) la identidad de las distribuciones de probabilidad que componen los factores, y (2) fórmulas interdependientes para los parámetros de estas distribuciones. Los valores reales de estos parámetros se calculan numéricamente, mediante un procedimiento iterativo alterno muy similar al algoritmo EM.
En comparación con la maximización de expectativas (EM)
El método bayesiano variacional (VB) se compara frecuentemente con el algoritmo de maximización de la esperanza (EM). El procedimiento numérico es bastante similar, ya que ambos son procedimientos iterativos alternados que convergen sucesivamente hacia valores óptimos de los parámetros. Los pasos iniciales para derivar los respectivos procedimientos también son vagamente similares, pues ambos parten de fórmulas para densidades de probabilidad e implican una cantidad considerable de manipulaciones matemáticas.
Sin embargo, existen varias diferencias. La más importante es qué es lo que se está calculando.
- El algoritmo EM calcula estimaciones puntuales de la distribución posterior de aquellas variables aleatorias que pueden clasificarse como "parámetros", pero solo estimaciones de las distribuciones posteriores reales de las variables latentes (al menos en el "EM suave", y a menudo solo cuando las variables latentes son discretas). Las estimaciones puntuales calculadas son las modas de estos parámetros; no se dispone de ninguna otra información.
- Por otro lado, VB calcula estimaciones de la distribución posterior real de todas las variables, tanto parámetros como variables latentes. Cuando se necesitan obtener estimaciones puntuales, generalmente se utiliza la media en lugar de la moda, como es habitual en la inferencia bayesiana. En consecuencia, los parámetros calculados en VB no tienen la misma significancia que los de EM. EM calcula los valores óptimos de los parámetros de la propia red bayesiana. VB calcula los valores óptimos de los parámetros de las distribuciones utilizadas para aproximar los parámetros y las variables latentes de la red bayesiana. Por ejemplo, un modelo de mezcla gaussiana típico tendrá parámetros para la media y la varianza de cada uno de los componentes de la mezcla. EM estimaría directamente los valores óptimos para estos parámetros. VB, sin embargo, primero ajustaría una distribución a estos parámetros —normalmente en forma de una distribución a priori , por ejemplo, una distribución gamma inversa escalada normal— y luego calcularía los valores para los parámetros de esta distribución a priori, es decir, esencialmente hiperparámetros . En este caso, VB calcularía estimaciones óptimas de los cuatro parámetros de la distribución gamma inversa escalada normal que describe la distribución conjunta de la media y la varianza del componente.
Un ejemplo más complejo

Imaginemos un modelo de mezcla gaussiana bayesiana descrito de la siguiente manera: [ 3 ]
Nota:
- SymDir() es la distribución de Dirichlet simétrica de dimensión, con el hiperparámetro para cada componente establecido enLa distribución de Dirichlet es la distribución a priori conjugada de la distribución categórica o distribución multinomial .
- es la distribución de Wishart , que es la distribución a priori conjugada de la matriz de precisión ( matriz de covarianza inversa ) para una distribución gaussiana multivariada .
- Mult() es una distribución multinomial sobre una sola observación (equivalente a una distribución categórica ). El espacio de estados es una representación "uno de K", es decir,Vector de dimensión en el que uno de los elementos es 1 (especificando la identidad de la observación) y todos los demás elementos son 0.
- es la distribución gaussiana , en este caso específicamente la distribución gaussiana multivariada .
La interpretación de las variables anteriores es la siguiente:
- es el conjunto depuntos de datos, cada uno de los cuales es unVector de -dimensiones distribuido según una distribución gaussiana multivariada .
- es un conjunto de variables latentes, una por punto de datos, que especifican a qué componente de la mezcla pertenece el punto de datos correspondiente, utilizando una representación vectorial "uno de K" con componentespara, como se describió anteriormente.
- son las proporciones de mezcla para elcomponentes de la mezcla.
- yEspecifique los parámetros ( media y precisión ) asociados a cada componente de la mezcla.
La probabilidad conjunta de todas las variables se puede reescribir como
donde los factores individuales son
dónde
Supongamos que.
Entonces [ 3 ]
donde hemos definido
Elevando al exponente ambos lados de la fórmula pararendimientos
Exigir que esto se normalice termina exigiendo que elsumar 1 sobre todos los valores de, produciendo
dónde
En otras palabras,es un producto de distribuciones multinomiales de una sola observación y factores sobre cada individuo, que se distribuye como una distribución multinomial de una sola observación con parámetrospara.
Además, observamos que
lo cual es un resultado estándar para distribuciones categóricas.
Ahora, considerando el factor, tenga en cuenta que automáticamente influye endebido a la estructura del modelo gráfico que define nuestro modelo de mezcla gaussiana, que se especifica más arriba.
Entonces,
Tomando la exponencial de ambos lados, reconocemos:como una distribución de Dirichlet
dónde
dónde
Finalmente
Agrupar y leer términos que involucreny, el resultado es una distribución gaussiana-de Wishart dada por
dadas las definiciones
Finalmente, observe que estas funciones requieren los valores de, que hacen uso de, que a su vez se define en función de,, yAhora que hemos determinado las distribuciones sobre las que se toman estas esperanzas, podemos derivar fórmulas para ellas:
Estos resultados conducen a
Estos se pueden convertir de valores proporcionales a valores absolutos normalizando sobrede modo que la suma de los valores correspondientes sea igual a 1.
Tenga en cuenta que:
- Las ecuaciones de actualización para los parámetros,,yde las variablesydepende de las estadísticas,, yy estas estadísticas a su vez dependen de.
- Las ecuaciones de actualización para los parámetrosde la variabledepende de la estadística, que a su vez depende de.
- La ecuación de actualización paratiene una dependencia circular directa de,,yasí como una dependencia circular indirecta de,ya través dey.
Esto sugiere un procedimiento iterativo que alterna entre dos pasos:
- Un paso E que calcula el valor deutilizando los valores actuales de todos los demás parámetros.
- Un paso M que utiliza el nuevo valor depara calcular nuevos valores de todos los demás parámetros.
Tenga en cuenta que estos pasos se corresponden estrechamente con el algoritmo EM estándar para derivar una solución de máxima verosimilitud o máxima a posteriori (MAP) para los parámetros de un modelo de mezcla gaussiana . Las responsabilidadesen el paso E se corresponden estrechamente con las probabilidades posteriores de las variables latentes dados los datos, es decir; el cálculo de las estadísticas,, ycorresponde estrechamente al cálculo de las estadísticas de "conteo suave" correspondientes sobre los datos; y el uso de esas estadísticas para calcular nuevos valores de los parámetros corresponde estrechamente al uso de conteos suaves para calcular nuevos valores de parámetros en EM normal sobre un modelo de mezcla gaussiana.
Distribuciones de la familia exponencial
Nótese que en el ejemplo anterior, una vez que se asumió que la distribución sobre las variables no observadas se factorizaba en distribuciones sobre los "parámetros" y distribuciones sobre los "datos latentes", la distribución "óptima" derivada para cada variable pertenecía a la misma familia que la distribución previa correspondiente sobre la variable. Este es un resultado general que se cumple para todas las distribuciones previas derivadas de la familia exponencial .
Véase también
- Paso de mensajes variacional : un algoritmo modular para la inferencia bayesiana variacional.
- Autoencoder variacional : una red neuronal artificial perteneciente a las familias de modelos gráficos probabilísticos y métodos bayesianos variacionales.
- Algoritmo de expectativa-maximización : un enfoque relacionado que corresponde a un caso especial de inferencia bayesiana variacional.
- Filtrado generalizado : un esquema de filtrado variacional para modelos de espacio de estados no lineales.
- Cálculo de variaciones : el campo del análisis matemático que se ocupa de maximizar o minimizar funciones.
- Discriminación de entropía máxima : Este es un marco de inferencia variacional que permite introducir y tener en cuenta restricciones adicionales de margen amplio [ 7 ].
Referencias
- 1 2 3 4 Tran, Viet Hung (2018). "Copula Variational Bayes inference via information geometry". arXiv : 1803.10998 [ cs.IT ].
- 1 2 Adamčík, Martin (2014). "La geometría de la información de las divergencias de Bregman y algunas aplicaciones en el razonamiento multiexperto" . Entropy . 16 (12): 6338– 6381. Bibcode : 2014Entrp..16.6338A . doi : 10.3390/e16126338 .
- 1 2 3 Nguyen, Duy (15 de agosto de 2023). "Una introducción en profundidad a la nota de Bayes variacional" . doi : 10.2139/ssrn.4541076 . SSRN 4541076. Recuperado el 15 de agosto de 2023 .
- 1 2 3 Lee, Se Yoon (2021). "Inferencia variacional de Gibbs sampler y de ascenso de coordenadas: una revisión desde la teoría de conjuntos". Communications in Statistics - Theory and Methods . 51 (6): 1– 21. arXiv : 2008.01006 . doi : 10.1080/03610926.2021.1921214 . S2CID 220935477 .
- ↑ Boyd, Stephen P.; Vandenberghe, Lieven (2004). Optimización convexa (PDF) . Cambridge University Press. ISBN 978-0-521-83378-3. Consultado el 15 de octubre de 2011 .
- ↑ Bishop, Christopher M. (2006). «Capítulo 10». Reconocimiento de patrones y aprendizaje automático . Springer. ISBN 978-0-387-31073-2.
- ↑ Sotirios P. Chatzis, “ Máquinas de discriminación de entropía máxima con conmutación de Markov infinita ”, Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático (ICML). Journal of Machine Learning Research: Workshop and Conference Proceedings, vol. 28, n.º 3, págs. 729–737, junio de 2013.
Enlaces externos
- El libro de texto en línea: Information Theory, Inference, and Learning Algorithms Archived 2017-05-12 at the Wayback Machine , de David JC MacKay, ofrece una introducción a los métodos variacionales (pág. 422).
- Un tutorial sobre Bayes variacional . Fox, C. y Roberts, S. 2012. Artificial Intelligence Review, doi : 10.1007/s10462-011-9236-8 .
- Repositorio Variacional-Bayes: Un repositorio de artículos de investigación, software y enlaces relacionados con el uso de métodos variacionales para el aprendizaje bayesiano aproximado hasta el año 2003.
- El libro Variational Algorithms for Approximate Bayesian Inference , de MJ Beal, incluye comparaciones del EM con el EM bayesiano variacional y derivaciones de varios modelos, incluidos los HMM bayesianos variacionales.
- Puede que valga la pena leer la explicación de alto nivel de la inferencia variacional de Jason Eisner antes de un análisis matemáticamente más detallado.
- Inferencia bayesiana variacional con cópulas mediante geometría de la información (pdf) por Tran, VH 2018. Este artículo está dirigido principalmente a estudiantes. Mediante la divergencia de Bregman , el artículo demuestra que la inferencia bayesiana variacional es simplemente una proyección pitagórica generalizada del modelo verdadero sobre un espacio de distribución arbitrariamente correlacionado (cópula), del cual el espacio independiente es solo un caso particular.
- Una introducción en profundidad a la teoría bayesiana variacional . Nota de Nguyen, D. 2023.
- estadística bayesiana