
La semántica distribucional [ 1 ] es un área de investigación que desarrolla y estudia teorías y métodos para cuantificar y categorizar las similitudes semánticas entre elementos lingüísticos basándose en sus propiedades distribucionales en grandes muestras de datos lingüísticos. La idea básica de la semántica distribucional se puede resumir en la hipótesis distribucional : los elementos lingüísticos con distribuciones similares tienen significados similares.
Hipótesis distributiva
La hipótesis distribucional en lingüística se deriva de la teoría semántica del uso del lenguaje, es decir, las palabras que se usan y aparecen en los mismos contextos tienden a tener significados similares. [ 2 ]
La idea subyacente de que "una palabra se caracteriza por la compañía que frecuenta" fue popularizada por Firth en la década de 1950. [ 3 ]
La hipótesis distribucional es la base de la semántica estadística . Aunque la hipótesis distribucional se originó en la lingüística, [ 4 ] [ 5 ] ahora está recibiendo atención en la ciencia cognitiva, especialmente en lo que respecta al contexto del uso de las palabras. [ 6 ]
En los últimos años, la hipótesis distributiva ha proporcionado la base para la teoría de la generalización basada en la similitud en el aprendizaje de idiomas: la idea de que los niños pueden descubrir cómo usar palabras que rara vez han encontrado antes generalizando sobre su uso a partir de distribuciones de palabras similares. [ 7 ] [ 8 ]
La hipótesis distribucional sugiere que cuanto más similares sean semánticamente dos palabras, más similares serán a su vez en cuanto a su distribución, y por lo tanto, más tenderán a aparecer en contextos lingüísticos similares.
No está claro si esta sugerencia tiene implicaciones significativas tanto para el problema de la escasez de datos en el modelado computacional [ 9 ] como para la cuestión de cómo los niños son capaces de aprender el lenguaje tan rápidamente con una entrada relativamente pobre (esto también se conoce como el problema de la pobreza del estímulo ).
Modelado semántico distribucional en espacios vectoriales
La semántica distribucional favorece el uso del álgebra lineal como herramienta computacional y marco de representación. El enfoque básico consiste en recopilar información distribucional en vectores de alta dimensión y definir la similitud distribucional/semántica en términos de similitud vectorial. [ 10 ] Se pueden extraer diferentes tipos de similitudes según el tipo de información distribucional que se utilice para recopilar los vectores: las similitudes temáticas se pueden extraer completando los vectores con información sobre las regiones de texto en las que aparecen los elementos lingüísticos; las similitudes paradigmáticas se pueden extraer completando los vectores con información sobre con qué otros elementos lingüísticos coocurren los elementos. Cabe señalar que este último tipo de vectores también se puede utilizar para extraer similitudes sintagmáticas analizando los componentes individuales del vector.
La idea básica de una correlación entre la similitud distribucional y semántica puede operacionalizarse de muchas maneras diferentes. Existe una rica variedad de modelos computacionales que implementan la semántica distribucional, incluyendo el análisis semántico latente (LSA), [ 11 ] [ 12 ] el Hyperspace Analogue to Language (HAL), modelos basados en sintaxis o dependencia, [ 13 ] indexación aleatoria , plegado semántico [ 14 ] y varias variantes del modelo de temas . [ 15 ]
Los modelos semánticos distribucionales difieren principalmente con respecto a los siguientes parámetros:
- Tipo de contexto (regiones de texto frente a elementos lingüísticos)
- Ventana de contexto (tamaño, extensión, etc.)
- Ponderación de frecuencia (por ejemplo , entropía , información mutua puntual , [ 16 ] etc.)
- Reducción de dimensionalidad (por ejemplo, indexación aleatoria , descomposición en valores singulares , etc.)
- Medida de similitud (por ejemplo, similitud del coseno , distancia de Minkowski , etc.)
Los modelos semánticos distribucionales que utilizan elementos lingüísticos como contexto también se han denominado modelos de espacio de palabras o de espacio vectorial . [ 17 ] [ 18 ]
Más allá de la semántica léxica
Aunque la semántica distribucional se ha aplicado típicamente a elementos léxicos —palabras y términos multipalabra— con considerable éxito, sobre todo debido a su aplicabilidad como capa de entrada para modelos de aprendizaje profundo inspirados en redes neuronales, la semántica léxica , es decir, el significado de las palabras, solo abarca parte de la semántica de una oración completa. El significado de una cláusula, por ejemplo, "Los tigres aman a los conejos" , solo puede entenderse parcialmente al examinar el significado de los tres elementos léxicos que la componen. La semántica distribucional puede extenderse fácilmente para abarcar elementos lingüísticos más grandes, como las construcciones, con y sin elementos no instanciados, pero es necesario ajustar algunos de los supuestos básicos del modelo. La gramática de construcciones y su formulación del continuo léxico-sintáctico ofrecen un enfoque para incluir construcciones más elaboradas en un modelo semántico distribucional, y se han implementado algunos experimentos utilizando el enfoque de indexación aleatoria. [ 19 ]
Los modelos semánticos distribucionales composicionales extienden los modelos semánticos distribucionales mediante funciones semánticas explícitas que utilizan reglas sintácticas para combinar la semántica de las unidades léxicas participantes en un modelo composicional que caracteriza la semántica de frases u oraciones completas. Este trabajo fue propuesto originalmente por Stephen Clark, Bob Coecke y Mehrnoosh Sadrzadeh de la Universidad de Oxford en su artículo de 2008, "Un modelo distribucional composicional del significado". [ 20 ] Se han explorado diferentes enfoques de composición, incluidos los modelos neuronales, y se están debatiendo en talleres establecidos como SemEval . [ 21 ]
Aplicaciones
Los modelos semánticos distribucionales se han aplicado con éxito a las siguientes tareas:
- encontrar similitud semántica entre palabras y expresiones compuestas por varias palabras;
- Agrupación de palabras basada en la similitud semántica;
- Creación automática de tesauros y diccionarios bilingües;
- desambiguación del sentido de las palabras ;
- Ampliar las solicitudes de búsqueda utilizando sinónimos y asociaciones;
- definir el tema de un documento;
- Agrupación de documentos para la recuperación de información ;
- minería de datos y reconocimiento de entidades nombradas ;
- creación de mapas semánticos de diferentes dominios temáticos;
- parafraseando ;
- análisis de sentimientos ;
- modelado de preferencias de selección de palabras.
Software
- Espacio S
- Vectores semánticos
- Gensim
- Constructor de DISCO
- Indra
Véase también
- Parecido familiar : idea filosófica popularizada por Ludwig Wittgenstein.
- Espacio conceptual
- Coocurrencia
- Base de datos distribucional-relacional
- Gensim
- Frase
- Indexación aleatoria
- Incrustaciones de oraciones
- semántica estadística
- Word2vec
- Incrustaciones de palabras
Gente
Referencias
- ↑ Lenci, Alessandro; Sahlgren, Magnus (2023). Semántica distribucional . Cambridge University Press. ISBN 9780511783692.
- ↑ Harris 1954
- ↑ Firth 1957
- ↑ Sahlgren 2008
- ↑ Sahlgren 2024
- ↑ McDonald y Ramscar 2001
- ↑ Gleitman 2002
- ↑ Yarlett 2008
- ↑ Wishart, Ryder; Prokopidis, Prokopis (2017). Experimentos de modelado de temas en corpus helenísticos (PDF) . Actas del Taller sobre Corpus en Humanidades Digitales 17. S2CID 9191936 .
- ↑ Rieger 1991
- ↑ Deerwester et al. 1990
- ↑ Landauer, Thomas K.; Dumais, Susan T. (1997). "Una solución al problema de Platón: La teoría del análisis semántico latente de la adquisición, inducción y representación del conocimiento". Psychological Review . 104 (2): 211– 240. doi : 10.1037/0033-295x.104.2.211 .
- ↑ Padó y Lapata 2007
- ↑ De Sousa Webber, Francisco (2015). "Teoría del plegado semántico y su aplicación en la huella digital semántica". arXiv : 1511.08855 [ cs.AI ].
- ↑ Jordan, Michael I.; Ng, Andrew Y.; Blei, David M. (2003). "Asignación latente de Dirichlet" . Journal of Machine Learning Research . 3 (enero): 993–1022 .
- ↑ Church, Kenneth Ward; Hanks, Patrick (1989). "Normas de asociación de palabras, información mutua y lexicografía" . Actas de la 27.ª Reunión Anual de la Asociación de Lingüística Computacional . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 76–83 . doi : 10.3115/981623.981633 .
- ↑ Schütze 1993
- ↑ Sahlgren 2006
- ↑ Karlgren, Jussi; Kanerva, Pentti (julio de 2019). "Espacios semánticos distribuidos de alta dimensión para enunciados". Ingeniería del lenguaje natural . 25 (4): 503– 517. arXiv : 2104.00424 . doi : 10.1017/S1351324919000226 . S2CID 201141249 .
- ↑ Clark, Stephen; Coecke, Bob; Sadrzadeh, Mehrnoosh (2008). "Un modelo distribucional composicional del significado" (PDF) . Actas del Segundo Simposio de Interacción Cuántica : 133–140 .
- ↑ "SemEval-2014, Tarea 1" .
Fuentes
- Harris, Z. (1954). "Estructura distributiva". Word . 10 (23): 146– 162. doi : 10.1080/00437956.1954.11659520 .
- Firth, JR (1957). "Una sinopsis de la teoría lingüística 1930-1955". Estudios de análisis lingüístico : 1–32 .Reimpreso en FR Palmer, ed. (1968). Selected Papers of JR Firth 1952-1959 . Londres: Longman.
{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace ) - Lenci, Alessandro; Sahlgren, Magnus (2023). Semántica distribucional . Cambridge University Press. ISBN 9780511783692.
- Sahlgren, Magnus (2008). "La hipótesis distributiva" (PDF) . Rivista di Linguistica . 20 (1): 33– 53. Archivado del original (PDF) el 15 de marzo de 2012. Recuperado el 10 de diciembre de 2010 .
- McDonald, S.; Ramscar, M. (2001). "Poniendo a prueba la hipótesis distribucional: La influencia del contexto en los juicios de similitud semántica". Actas de la 23.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas . págs. 611–616 . CiteSeerX 10.1.1.104.7535 .
- Gleitman, Lila R. (2002). «Verbos de la misma especie se juntan II». El legado de Zellig Harris . Temas actuales en teoría lingüística. Vol. 1. págs. 209–229 . doi : 10.1075/cilt.228.17gle . ISBN 978-90-272-4736-0.
- Yarlett, D. (2008). Aprendizaje de idiomas mediante generalización basada en similitud (PDF) (tesis doctoral). Universidad de Stanford. Archivado del original (PDF) el 19 de abril de 2014. Recuperado el 12 de julio de 2012 .
- Rieger, Burghard B. (1991). Sobre representaciones distribuidas en la semántica de palabras (PDF) (Informe). ICSI Berkeley 12-1991. CiteSeerX 10.1.1.37.7976 .
- Deerwester, Scott; Dumais, Susan T.; Furnas, George W.; Landauer, Thomas K.; Harshman, Richard (1990). "Indexación mediante análisis semántico latente" (PDF) . Journal of the American Society for Information Science . 41 (6): 391– 407. CiteSeerX 10.1.1.33.2447 . doi : 10.1002/(SICI)1097-4571(199009)41:6 < 391::AID-ASI1 > 3.0.CO ; 2-9 . Archivado del original (PDF) el 17 de julio de 2012.
- Padó, Sebastian; Lapata, Mirella (2007). "Construcción de modelos de espacio semántico basados en dependencias" . Lingüística Computacional . 33 (2): 161– 199. doi : 10.1162/coli.2007.33.2.161 . S2CID 7747235 .
- Schütze, Hinrich (1993). "Espacio de palabras". Avances en los sistemas de procesamiento de información neuronal 5 . págs. 895–902 . CiteSeerX 10.1.1.41.8856 .
- Sahlgren, Magnus (2006). El modelo del espacio de palabras (PDF) (tesis doctoral). Universidad de Estocolmo. Archivado del original (PDF) el 19 de junio de 2012. Consultado el 26 de noviembre de 2012 .
- Sahlgren, Magnus (diciembre de 2024). "Legado distributivo: la eficacia irrazonable del programa distributivo de Harris" . WORD . 70 (4): 246–257 . doi : 10.1080/00437956.2024.2414515 .
- Thomas Landauer; Susan T. Dumais. "Una solución al problema de Platón: la teoría del análisis semántico latente de la adquisición, inducción y representación del conocimiento" . Consultado el 2 de julio de 2007 .
- Kevin Lund; Curt Burgess; Ruth Ann Atchley (1995). Activación semántica y asociativa en un espacio semántico de alta dimensión . Actas de Ciencias Cognitivas. págs. 660–665 .
- Kevin Lund; Curt Burgess (1996). "Producción de espacios semánticos de alta dimensión a partir de la coocurrencia léxica" . Behavior Research Methods, Instruments, and Computers . 28 (2): 203– 208. doi : 10.3758/bf03204766 .
Enlaces externos
- Zellig S. Harris
- Lingüística computacional
- Semántica
- Adquisición del lenguaje
- Relaciones semánticas