En el ámbito de la estadística , los modelos de temas dinámicos son modelos generativos que se pueden utilizar para analizar la evolución de temas (no observados) de una colección de documentos a lo largo del tiempo. Esta familia de modelos fue propuesta por David Blei y John Lafferty y es una extensión de la asignación de Dirichlet latente (LDA) que puede manejar documentos secuenciales. [1]
En LDA, tanto el orden en que aparecen las palabras en un documento como el orden en que aparecen los documentos en el corpus son ajenos al modelo. Mientras que todavía se supone que las palabras son intercambiables , en un modelo de tópicos dinámicos el orden de los documentos juega un papel fundamental. Más precisamente, los documentos se agrupan por franjas temporales (p. ej.: años) y se supone que los documentos de cada grupo provienen de un conjunto de tópicos que evolucionaron a partir del conjunto de la franja anterior.
Temas
De manera similar a LDA y pLSA , en un modelo de temas dinámicos, cada documento se considera como una mezcla de temas no observados. Además, cada tema define una distribución multinomial sobre un conjunto de términos. Por lo tanto, para cada palabra de cada documento, se extrae un tema de la mezcla y, posteriormente, se extrae un término de la distribución multinomial correspondiente a ese tema.
Sin embargo, los temas evolucionan con el tiempo. Por ejemplo, los dos términos más probables de un tema en el momento t podrían ser "red" y "Zipf" (en orden descendente), mientras que los más probables en el momento t+1 podrían ser "Zipf" y "percolación" (en orden descendente).
Modelo
Definir
- como la distribución de temas por documento en el momento t .
- como la distribución de palabras del tema k en el tiempo t .
- como la distribución de temas para el documento d en el tiempo t ,
- como tema de la n- ésima palabra del documento d en el tiempo t , y
- como la palabra específica.
En este modelo, las distribuciones multinomiales y se generan a partir de y , respectivamente. Si bien las distribuciones multinomiales suelen escribirse en términos de los parámetros medios, es mejor representarlas en términos de los parámetros naturales en el contexto de los modelos de temas dinámicos.
La primera representación tiene algunas desventajas debido al hecho de que los parámetros están restringidos a ser no negativos y sumar uno. [2] Al definir la evolución de estas distribuciones, uno necesitaría asegurarse de que tales restricciones se satisfagan. Dado que ambas distribuciones están en la familia exponencial , una solución a este problema es representarlas en términos de los parámetros naturales, que pueden asumir cualquier valor real y pueden cambiarse individualmente.
Utilizando la parametrización natural, la dinámica del modelo de tema está dada por
y
- .
Por lo tanto, el proceso generativo en el intervalo de tiempo 't' es:
- Temas de sorteo
- Dibujar modelo de mezcla
- Para cada documento:
- Dibujar
- Para cada palabra:
- Tema del sorteo
- Dibujar palabra
donde es una aplicación de la parametrización natural x a la parametrización media, es decir
- .
Inferencia
En el modelo de tópico dinámico, sólo es observable. Aprender los otros parámetros constituye un problema de inferencia. Blei y Lafferty sostienen que aplicar el muestreo de Gibbs para hacer inferencia en este modelo es más difícil que en los modelos estáticos, debido a la no conjugación de las distribuciones gaussiana y multinomial. Proponen el uso de métodos variacionales , en particular, el filtrado de Kalman variacional y la regresión wavelet variacional.
Aplicaciones
En el artículo original, se aplica un modelo de temas dinámicos al corpus de artículos científicos publicados entre 1881 y 1999 con el objetivo de demostrar que este método puede utilizarse para analizar las tendencias de uso de palabras dentro de los temas. [1] Los autores también muestran que el modelo entrenado con documentos pasados puede ajustarse mejor a los documentos de un año entrante que LDA.
Wang et al. desarrollaron un modelo de tema dinámico continuo y lo aplicaron para predecir la marca de tiempo de los documentos. [3]
Más allá de los documentos de texto, se utilizaron modelos temáticos dinámicos para estudiar la influencia musical, aprendiendo temas musicales y cómo evolucionan en la historia reciente. [4]
Referencias
- ^ ab Blei, David M; Lafferty, John D (2006). "Modelos de temas dinámicos". Actas de la 23.ª conferencia internacional sobre aprendizaje automático - ICML '06 . ICML'06. págs. 113– 120. doi :10.1145/1143844.1143859. ISBN 978-1-59593-383-6. Número de identificación del sujeto 5405229.
- ^ Rennie, Jason DM "Mezclas de multinomios" (PDF) . Consultado el 5 de diciembre de 2011 .
- ^ Wang, Chong; Blei, David; Heckerman, David (2008). "Modelos temáticos dinámicos de tiempo continuo". Actas del ICML . ICML '08.
- ^ Shalit, Uri; Weinshall, Daphna; Chechik, Gal (2013). "Modelado de la influencia musical con modelos de temas" (PDF) . Revista de investigación en aprendizaje automático .