El análisis semántico latente probabilístico ( PLSA ), también conocido como indexación semántica latente probabilística ( PLSI , especialmente en los círculos de recuperación de información), es una técnica estadística para el análisis de datos de coocurrencia y bimodales. En efecto, se puede derivar una representación de baja dimensión de las variables observadas en términos de su afinidad con ciertas variables ocultas, al igual que en el análisis semántico latente , del que evolucionó el PLSA.
En comparación con el análisis semántico latente estándar , que proviene del álgebra lineal y reduce el tamaño de las tablas de ocurrencia (generalmente a través de una descomposición en valores singulares ), el análisis semántico latente probabilístico se basa en una descomposición de mezcla derivada de un modelo de clase latente .
Modelo

Considerando observaciones en forma de co-ocurrencias de palabras y documentos, PLSA modela la probabilidad de cada co-ocurrencia como una mezcla de distribuciones multinomiales condicionalmente independientes :
con siendo el tema de las palabras. Nótese que el número de temas es un hiperparámetro que debe elegirse de antemano y no se estima a partir de los datos. La primera formulación es la formulación simétrica , donde y se generan a partir de la clase latente de formas similares (usando las probabilidades condicionales y ), mientras que la segunda formulación es la formulación asimétrica , donde, para cada documento , se elige una clase latente condicionalmente al documento según , y luego se genera una palabra a partir de esa clase según . Aunque hemos utilizado palabras y documentos en este ejemplo, la coocurrencia de cualquier par de variables discretas se puede modelar exactamente de la misma manera.
Por lo tanto, el número de parámetros es igual a . El número de parámetros crece linealmente con el número de documentos. Además, aunque PLSA es un modelo generativo de los documentos de la colección sobre la que se calcula, no es un modelo generativo de nuevos documentos.
Sus parámetros se aprenden utilizando el algoritmo EM .
Solicitud
PLSA se puede utilizar en un entorno discriminativo, a través de núcleos de Fisher . [1]
PLSA tiene aplicaciones en recuperación y filtrado de información , procesamiento del lenguaje natural , aprendizaje automático a partir de texto, bioinformática [ 2] y áreas relacionadas.
Se informa que el modelo de aspecto utilizado en el análisis semántico latente probabilístico tiene graves problemas de sobreajuste . [3]
Extensiones
- Extensiones jerárquicas:
- Asimétrico: MASHA ("Análisis jerárquico asimétrico multinomial") [4]
- Simétrico: HPLSA ("Hierarchical Probabilistic Latent Semantic Analysis") [5]
- Modelos generativos: Los siguientes modelos se han desarrollado para abordar una deficiencia a menudo criticada de PLSA, a saber, que no es un modelo generativo adecuado para documentos nuevos.
- Asignación de Dirichlet latente : agrega un Dirichlet anterior a la distribución de temas por documento
- Datos de orden superior: aunque esto rara vez se analiza en la literatura científica, el PLSA se extiende naturalmente a datos de orden superior (tres modas y superiores), es decir, puede modelar coocurrencias en tres o más variables. En la formulación simétrica anterior, esto se hace simplemente agregando distribuciones de probabilidad condicional para estas variables adicionales. Este es el análogo probabilístico de la factorización tensorial no negativa.
Historia
Este es un ejemplo de un modelo de clase latente (ver referencias en el mismo) y está relacionado [6] [7] con la factorización de matrices no negativas . La terminología actual fue acuñada en 1999 por Thomas Hofmann. [8]
Véase también
Referencias y notas
- ^ Thomas Hofmann, Aprendiendo la similitud de los documentos: un enfoque geométrico de la información para la recuperación y categorización de documentos, Advances in Neural Information Processing Systems 12, pp-914-920, MIT Press , 2000
- ^ Pinoli, Pietro; et, al. (2013). "Análisis semántico latente probabilístico mejorado con esquemas de ponderación para predecir anotaciones genómicas". Actas de IEEE BIBE 2013. La 13.ª Conferencia Internacional IEEE sobre Bioinformática y Bioingeniería. IEEE. págs. 1– 4. doi :10.1109/BIBE.2013.6701702. ISBN . 978-147993163-7.
- ^ Blei, David M.; Andrew Y. Ng; Michael I. Jordan (2003). "Asignación de Dirichlet latente" (PDF) . Revista de investigación en aprendizaje automático . 3 : 993– 1022. doi :10.1162/jmlr.2003.3.4-5.993.
- ^ Alexei Vinokourov y Mark Girolami, Un marco probabilístico para la organización jerárquica y la clasificación de colecciones de documentos, en Procesamiento y gestión de la información , 2002
- ^ Eric Gaussier, Cyril Goutte, Kris Popat y Francine Chen, Un modelo jerárquico para agrupar y categorizar documentos Archivado el 4 de marzo de 2016 en Wayback Machine , en "Avances en recuperación de información - Actas del 24.º Coloquio europeo BCS-IRSG sobre investigación en RI (ECIR-02)", 2002
- ^ Chris Ding, Tao Li, Wei Peng (2006). "Factorización de matrices no negativas e indexación semántica latente probabilística: estadística de chi-cuadrado de equivalencia y un método híbrido. AAAI 2006"
- ^ Chris Ding, Tao Li, Wei Peng (2008). "Sobre la equivalencia entre la factorización matricial no negativa y la indexación semántica latente probabilística"
- ^ Thomas Hofmann, Indexación semántica latente probabilística, Actas de la vigésimo segunda conferencia internacional anual SIGIR sobre investigación y desarrollo en recuperación de información (SIGIR-99), 1999
Enlaces externos
- Análisis semántico latente probabilístico
- DEMO PLSA completa en C#