En los métodos bayesianos variacionales , el límite inferior de la evidencia (a menudo abreviado ELBO , también llamado a veces límite inferior variacional [1] o energía libre v...
Hispanopedia WikiContenido en espanolLectura gratuita
En los métodos bayesianos variacionales , el límite inferior de la evidencia (a menudo abreviado ELBO , también llamado a veces límite inferior variacional [1] o energía libre variacional negativa ) es un límite inferior útil en la verosimilitud logarítmica de algunos datos observados.
El ELBO es útil porque proporciona una garantía en el peor de los casos para la verosimilitud logarítmica de alguna distribución (p. ej., ) que modela un conjunto de datos. La verosimilitud logarítmica real puede ser mayor (lo que indica un ajuste aún mejor a la distribución) porque el ELBO incluye un término de divergencia de Kullback-Leibler (divergencia KL) que disminuye el ELBO debido a que una parte interna del modelo es inexacta a pesar de un buen ajuste del modelo en general. Por lo tanto, mejorar la puntuación ELBO indica una mejora de la verosimilitud del modelo o del ajuste de un componente interno al modelo, o ambos, y la puntuación ELBO constituye una buena función de pérdida , p. ej., para entrenar una red neuronal profunda para mejorar tanto el modelo en general como el componente interno. (El componente interno es , definido en detalle más adelante en este artículo).
En la primera línea, es la entropía de , que relaciona el ELBO con la energía libre de Helmholtz . [3] En la segunda línea, se denomina evidencia para , y es la divergencia de Kullback-Leibler entre y . Dado que la divergencia de Kullback-Leibler no es negativa, forma un límite inferior en la evidencia ( desigualdad ELBO )
Motivación
Inferencia bayesiana variacional
Supongamos que tenemos una variable aleatoria observable y queremos encontrar su distribución verdadera . Esto nos permitiría generar datos mediante muestreo y estimar probabilidades de eventos futuros. En general, es imposible encontrarla con exactitud, lo que nos obliga a buscar una buena aproximación .
Es decir, definimos una familia paramétrica de distribuciones suficientemente grande y luego calculamos para alguna función de pérdida . Una forma posible de resolver esto es considerar una pequeña variación de a , y calcular para . Este es un problema en el cálculo de variaciones , por lo que se denomina método variacional .
Dado que no hay muchas familias de distribuciones explícitamente parametrizadas (todas las familias de distribuciones clásicas, como la distribución normal, la distribución de Gumbel, etc., son demasiado simplistas para modelar la distribución verdadera), consideramos distribuciones de probabilidad
implícitamente parametrizadas :
En primer lugar, defina una distribución simple sobre una variable aleatoria latente . Por lo general, basta con una distribución normal o uniforme.
A continuación, defina una familia de funciones complicadas (como una red neuronal profunda ) parametrizadas por .
Por último, defina una forma de convertir cualquier distribución en una distribución simple sobre la variable aleatoria observable . Por ejemplo, supongamos que tenemos dos salidas, entonces podemos definir la distribución correspondiente sobre como la distribución normal .
Esto define una familia de distribuciones conjuntas sobre . Es muy fácil muestrear : simplemente muestree , luego calcule y finalmente muestree utilizando .
En otras palabras, tenemos un modelo generativo tanto para lo observable como para lo latente. Ahora, consideramos que una distribución es buena si es una aproximación cercana de : dado que la distribución del lado derecho es solamente sobre , la distribución del lado izquierdo debe marginar la variable latente .
En general, es imposible realizar la integral , lo que nos obliga a realizar otra aproximación.
Dado que ( regla de Bayes ), basta con encontrar una buena aproximación de . Por lo tanto, defina otra familia de distribución y utilícela para aproximar . Este es un modelo discriminativo para latente.
La situación completa se resume en el siguiente cuadro:
En lenguaje bayesiano , es la evidencia observada y es la evidencia latente/no observada. La distribución sobre es la distribución previa sobre , es la función de verosimilitud y es la distribución posterior sobre .
Dada una observación , podemos inferir lo que probablemente dio lugar a calculando . El método bayesiano habitual es estimar la integral y luego calcular mediante la regla de Bayes . Esto es costoso de realizar en general, pero si simplemente podemos encontrar una buena aproximación para la mayoría de , entonces podemos inferir de manera económica. Por lo tanto, la búsqueda de un bien también se llama inferencia amortizada .
En resumen, hemos encontrado un problema de inferencia bayesiana variacional .
Derivación del ELBO
Un resultado básico en la inferencia variacional es que minimizar la divergencia de Kullback-Leibler (divergencia KL) es equivalente a maximizar la verosimilitud logarítmica: donde es la entropía de la distribución verdadera. Por lo tanto, si podemos maximizar , podemos minimizar , y en consecuencia encontrar una aproximación precisa .
Para maximizar , simplemente tomamos una muestra de muchos , es decir, utilizamos un muestreo de importancia , donde es la cantidad de muestras extraídas de la distribución verdadera. Esta aproximación puede considerarse como sobreajuste. [nota 1]
Para maximizar , es necesario encontrar : Esto normalmente no tiene forma cerrada y debe estimarse. La forma habitual de estimar integrales es la integración de Monte Carlo con muestreo de importancia : donde es una distribución de muestreo sobre que usamos para realizar la integración de Monte Carlo.
Así vemos que si tomamos una muestra de , entonces es un estimador insesgado de . Desafortunadamente, esto no nos da un estimador insesgado de , porque no es lineal. De hecho, tenemos por la desigualdad de Jensen , De hecho, todos los estimadores obvios de están sesgados hacia abajo, porque no importa cuántas muestras de tomemos, tenemos por la desigualdad de Jensen: Restando el lado derecho, vemos que el problema se reduce a un estimador sesgado de cero: En este punto, podríamos derivar hacia el desarrollo de un autocodificador ponderado por importancia [nota 2] , pero en su lugar continuaremos con el caso más simple con : La estrechez de la desigualdad tiene una forma cerrada: Hemos obtenido así la función ELBO:
Maximizando el ELBO
Para , la optimización intenta simultáneamente maximizar y minimizar . Si la parametrización para y es lo suficientemente flexible, obtendremos algún , de modo que tengamos simultáneamente
Dado que tenemos y por lo tanto En otras palabras, maximizar el ELBO nos permitiría simultáneamente obtener un modelo generativo preciso y un modelo discriminativo preciso . [5]
Formularios principales
El ELBO tiene muchas expresiones posibles, cada una con un énfasis diferente.
Esta forma muestra que si muestreamos , entonces es un estimador imparcial del ELBO.
Esta forma muestra que el ELBO es un límite inferior de la evidencia y que maximizar el ELBO con respecto a es equivalente a minimizar la divergencia KL de a .
Esta forma muestra que maximizar el ELBO intenta simultáneamente mantenerse cerca y concentrarse en aquellos que maximizan . Es decir, el posterior aproximado se equilibra entre mantenerse cerca del anterior y avanzar hacia la máxima probabilidad .
Desigualdad en el procesamiento de datos
Supongamos que tomamos muestras independientes de y las recopilamos en el conjunto de datos , entonces tenemos una distribución empírica .
El ajuste a se puede hacer, como de costumbre, maximizando la log-verosimilitud : Ahora, por la desigualdad ELBO, podemos limitar , y por lo tanto El lado derecho se simplifica a una divergencia KL, y así obtenemos: Este resultado se puede interpretar como un caso especial de la desigualdad de procesamiento de datos .
En esta interpretación, maximizar es minimizar , lo que limita superiormente la cantidad real de interés a través de la desigualdad de procesamiento de datos. Es decir, agregamos un espacio latente al espacio observable, pagando el precio de una desigualdad más débil en aras de una minimización computacionalmente más eficiente de la divergencia KL. [6]
Referencias
^ Kingma, Diederik P.; Welling, Max (1 de mayo de 2014). "Bayes variacionales de codificación automática". arXiv : 1312.6114 [estad.ML].
^ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). "Capítulo 19". Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass.: The MIT Press. ISBN 978-0-262-03561-3.
^ Hinton, Geoffrey E; Zemel, Richard (1993). "Autocodificadores, longitud mínima de descripción y energía libre de Helmholtz". Avances en sistemas de procesamiento de información neuronal . 6 . Morgan-Kaufmann.
^ Burda, Yuri; Grosse, Roger; Salakhutdinov, Ruslan (1 de septiembre de 2015). "Autocodificadores ponderados por importancia". arXiv : 1509.00519 [stat.ML].
^ Neal, Radford M.; Hinton, Geoffrey E. (1998), "Una visión del algoritmo Em que justifica variantes incrementales, dispersas y otras", Aprendizaje en modelos gráficos , Dordrecht: Springer Países Bajos, págs. 355–368, doi :10.1007/978-94-011-5014-9_12, ISBN 978-94-010-6104-9, Número de identificación del sujeto 17947141
^ Kingma, Diederik P.; Welling, Max (27 de noviembre de 2019). "Introducción a los autocodificadores variacionales". Fundamentos y tendencias en aprendizaje automático . 12 (4). Sección 2.7. arXiv : 1906.02691 . doi :10.1561/2200000056. ISSN 1935-8237. S2CID 174802445.
Notas
^ De hecho, según la desigualdad de Jensen ,
el estimador está sesgado hacia arriba. Esto puede considerarse como un sobreajuste: para un conjunto finito de datos muestreados
, suele haber algunos
que se ajustan mejor a ellos que la
distribución completa.
^ Por el método delta , tenemos Si continuamos con esto, obtendríamos el autocodificador ponderado por importancia. [4]