La teoría del plegado semántico describe un procedimiento para codificar la semántica del texto en lenguaje natural en una representación binaria con fundamento semántico. Este enfoque proporciona un marco para modelar cómo el neocórtex procesa los datos lingüísticos . [ 1 ]
Teoría
La teoría del plegado semántico se inspira en *Analogía como núcleo de la cognición* de Douglas R. Hofstadter, que sugiere que el cerebro da sentido al mundo identificando y aplicando analogías . [ 2 ] La teoría plantea la hipótesis de que los datos semánticos deben, por lo tanto, introducirse en la neocorteza de tal forma que permitan la aplicación de una medida de similitud y ofrece, como solución, el vector binario disperso que emplea un espacio semántico topográfico bidimensional como marco de referencia distribucional. La teoría se basa en la teoría computacional de la corteza humana conocida como memoria temporal jerárquica (MTH) y se posiciona como una teoría complementaria para la representación de la semántica del lenguaje.
Una ventaja particular que se atribuye a este enfoque es que la representación binaria resultante permite realizar operaciones semánticas complejas de forma sencilla y eficiente al nivel computacional más básico.
Espacio semántico bidimensional
De forma análoga a la estructura del neocórtex, la teoría del plegado semántico postula la implementación de un espacio semántico como una cuadrícula bidimensional. Esta cuadrícula se compone de vectores de contexto [ nota 1 ] dispuestos de manera que los vectores de contexto similares se acerquen entre sí, por ejemplo, mediante principios de aprendizaje competitivo. Este modelo de espacio vectorial se presenta en la teoría como una equivalencia al conocido modelo de espacio de palabras [ 3 ] descrito en la literatura sobre recuperación de información .
Dado un espacio semántico (implementado como se describió anteriormente), se puede obtener un vector de palabras [ nota 2 ] para cualquier palabra Y dada empleando el siguiente algoritmo :
Para cada posición X en el mapa semántico (donde X representa coordenadas cartesianas ), si la palabra Y está contenida en el vector de contexto en la posición X , entonces se suma 1 a la posición correspondiente en el vector de palabras para Y; de lo contrario, se suma 0 a la posición correspondiente en el vector de palabras para Y.
El resultado de este proceso será un vector de palabras que contiene todos los contextos en los que aparece la palabra Y y, por lo tanto, será representativo de la semántica de esa palabra en el espacio semántico. Se puede ver que el vector de palabras resultante también está en un formato de representación distribuida dispersa (SDR) [Schütze, 1993] y [Sahlgreen, 2006]. [ 3 ] [ 4 ] Algunas propiedades de las SDR de palabras que son de particular interés con respecto a la semántica computacional son: [ 5 ]
- Alta resistencia al ruido: Como resultado de que los contextos similares se colocan más cerca unos de otros en el mapa subyacente, los word-SDR son altamente tolerantes a los "bits" falsos o desplazados.
- Lógica booleana : Es posible manipular los SDR de palabras de manera significativa utilizando funciones booleanas (OR, AND, OR exclusivo) y/o aritméticas (SUBSTRATE).
- Submuestreo: Los Word-SDR se pueden submuestrear en gran medida sin ninguna pérdida apreciable de información semántica.
- Representación topológica bidimensional: La representación SDR mantiene la distribución topológica del mapa subyacente; por lo tanto, las palabras con significados similares tendrán vectores de palabras similares. Esto sugiere que se pueden aplicar diversas medidas para el cálculo de la similitud semántica , desde una simple superposición de elementos vectoriales hasta una gama de medidas de distancia tales como: distancia euclidiana , distancia de Hamming , distancia de Jaccard , similitud del coseno , distancia de Levenshtein , índice de Sørensen-Dice , etc.
Espacios semánticos
Los espacios semánticos [ nota 3 ] [ 6 ] en el dominio del lenguaje natural buscan crear representaciones del lenguaje natural capaces de capturar significado. La motivación original para los espacios semánticos surge de dos desafíos fundamentales del lenguaje natural: la falta de coincidencia de vocabulario (el hecho de que el mismo significado se puede expresar de muchas maneras) y la ambigüedad del lenguaje natural (el hecho de que el mismo término puede tener varios significados).
La aplicación de espacios semánticos en el procesamiento del lenguaje natural (PLN) busca superar las limitaciones de los enfoques basados en reglas o modelos que operan a nivel de palabra clave . El principal inconveniente de estos enfoques es su fragilidad y el gran esfuerzo manual requerido para crear sistemas de PLN basados en reglas o corpus de entrenamiento para el aprendizaje de modelos. [ 7 ] [ 8 ] Los modelos basados en reglas y en aprendizaje automático están fijos a nivel de palabra clave y fallan si el vocabulario difiere del definido en las reglas o del material de entrenamiento utilizado para los modelos estadísticos.
La investigación en espacios semánticos se remonta a más de 20 años. En 1996, se publicaron dos artículos que generaron gran interés en torno a la idea general de crear espacios semánticos: el análisis semántico latente [ 9 ] de Microsoft y el Hyperspace Analogue to Language [ 10 ] de la Universidad de California . Sin embargo, su adopción se vio limitada por el gran esfuerzo computacional necesario para construir y utilizar dichos espacios semánticos. Un avance significativo en cuanto a la precisión del modelado de relaciones asociativas entre palabras (por ejemplo, "araña-telaraña", "encendedor-cigarrillo", en contraposición a relaciones sinónimas como "ballena-delfín", "astronauta-conductor") se logró mediante el análisis semántico explícito (ESA) [ 11 ] en 2007. ESA fue un enfoque novedoso (no basado en aprendizaje automático) que representaba las palabras en forma de vectores con 100 000 dimensiones (donde cada dimensión representa un artículo de Wikipedia ). Sin embargo, las aplicaciones prácticas de este enfoque son limitadas debido a la gran cantidad de dimensiones requeridas en los vectores.
Más recientemente, los avances en las técnicas de redes neuronales en combinación con otros enfoques nuevos ( tensores ) llevaron a una serie de nuevos desarrollos recientes: Word2vec [ 12 ] de Google y GloVe [ 13 ] de la Universidad de Stanford .
El plegado semántico representa un enfoque novedoso, de inspiración biológica, para los espacios semánticos, donde cada palabra se representa como un vector binario disperso con 16 000 dimensiones (una huella digital semántica) en un mapa semántico bidimensional (el universo semántico). La representación binaria dispersa es ventajosa en términos de eficiencia computacional y permite almacenar un número muy elevado de patrones posibles. [ 5 ]
Visualización


La distribución topológica sobre una cuadrícula bidimensional (descrita anteriormente) permite una visualización tipo mapa de bits de la semántica de cualquier palabra o texto, donde cada característica semántica activa puede representarse, por ejemplo, como un píxel . Como se puede apreciar en las imágenes, esta representación posibilita una comparación visual directa de la semántica de dos (o más) elementos lingüísticos.
La imagen 1 demuestra claramente que los dos términos dispares "perro" y "coche" tienen, como era de esperar, semánticas muy obviamente diferentes.
La imagen 2 muestra que solo uno de los contextos de significado de "jaguar", el de "Jaguar" el automóvil, se superpone con el significado de Porsche (lo que indica una similitud parcial). Otros contextos de significado de "jaguar", por ejemplo, "jaguar" el animal, tienen claramente contextos diferentes que no se superponen. La visualización de la similitud semántica mediante el plegado semántico guarda un fuerte parecido con las imágenes de fMRI producidas en un estudio de investigación realizado por AG Huth et al., [ 14 ] [ 15 ] donde se afirma que las palabras se agrupan en el cerebro por significado. Se encontró que los vóxeles , pequeños segmentos de volumen del cerebro, siguen un patrón donde la información semántica se representa a lo largo del límite de la corteza visual con categorías visuales y lingüísticas representadas en el lado posterior y anterior respectivamente. [ 16 ] [ 17 ] [ 18 ]
Notas
- ↑ Un vector de contexto se define como un vector que contiene todas las palabras en un contexto particular.
- ↑ En la teoría del plegado semántico, un vector de palabras o un SDR de palabras se denomina huella semántica.
- ↑ También conocido como espacios semánticos distribuidos o memoria semántica distribuida
Referencias
- ↑ De Sousa Webber, Francisco (2015). "Teoría del plegado semántico y su aplicación en la huella digital semántica". Biblioteca de la Universidad de Cornell . arXiv : 1511.08855 . Bibcode : 2015arXiv151108855D .
- ↑ La mente analógica . Un libro de Bradford. 2 de marzo de 2001. ISBN 9780262072069. Consultado el 18 de abril de 2016 .
{{cite book}}:|website=ignorado ( ayuda ) - ^ Sahlgreen , Magnus (2006). "El modelo espacio-palabra" .
- ^ Schütze, Hinrich (1993). "Espacio de palabras": 895– 902. CiteSeerX 10.1.1.41.8856 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - 1 2 Subutai Ahmad; Jeff Hawkins (2015). "Propiedades de las representaciones distribuidas dispersas y su aplicación a la memoria temporal jerárquica". arXiv : 1503.07469 [ q-bio.NC ].
- ↑ Baroni, Marco; Lenci, Alessandro (2010). "Memoria distributiva: un marco general para la semántica basada en corpus". Lingüística computacional . 36 (4): 673– 721. CiteSeerX 10.1.1.331.3769 . doi : 10.1162/coli_a_00016 . S2CID 5584134 .
- ↑ Scott C. Deerwester; Susan T. Dumais; Thomas K. Landauer; George W. Furnas; Richard A. Harshen (1990). "Indexación mediante análisis semántico latente" (PDF) . Revista de la Sociedad Americana de Ciencias de la Información .
- ↑ Xing Wei; W. Bruce Croft (2007). "Investigación del rendimiento de la recuperación con modelos de temas construidos manualmente" . Actas de RIAO '07 Acceso semántico a gran escala al contenido (texto, imagen, vídeo y sonido) . Riao '07: 333–349 .
- ↑ "LSA: Una solución al problema de Platón" . lsa.colorado.edu . Consultado el 19 de abril de 2016 .
- ↑ Lund, Kevin; Burgess, Curt (1996-06-01). "Producción de espacios semánticos de alta dimensión a partir de la coocurrencia léxica" . Behavior Research Methods, Instruments, & Computers . 28 (2): 203– 208. doi : 10.3758/BF03204766 . ISSN 0743-3808 .
- ↑ Evgeniy Gabrilovich y Shaul Markovitch (2007). "Cálculo de la relación semántica mediante análisis semántico explícito basado en Wikipedia" (PDF) . Actas de la 20.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI). Págs. 1606–1611 . Archivado del original (PDF) el 29 de octubre de 2019. Consultado el 15 de septiembre de 2019 .
- ↑ Tomas Mikolov; Ilya Sutskever; Kai Chen; Greg Corrado; Jeffrey Dean (2013). "Representaciones distribuidas de palabras y frases y su composicionalidad". arXiv : 1310.4546 [ cs.CL ].
- ↑ Jeffrey Pennington; Richard Socher; Christopher D. Manning (2014). "GloVe: Vectores globales para la representación de palabras" (PDF) .
- ↑ Huth, Alexander (27 de abril de 2016). " El habla natural revela los mapas semánticos que recubren la corteza cerebral humana" . Nature . 532 (7600): 453–458 . Bibcode : 2016Natur.532..453H . doi : 10.1038/nature17637 . PMC 4852309. PMID 27121839 .
- ↑ "Cerebro" . gallantlab.org . Consultado el 16 de febrero de 2022 .
- ↑ Popham, Sara F.; Huth, Alexander G.; Bilenko, Natalia Y.; Deniz, Fatma; Gao, James S.; Nunez-Elizalde, Anwar O.; Gallant, Jack L. (11 de agosto de 2021). "Las representaciones semánticas visuales y lingüísticas se alinean en el límite de la corteza visual humana" . Nature Neuroscience . 24 (11): 1628– 1636. doi : 10.1038/s41593-021-00921-6 . ISSN 1097-6256 . PMID 34711960. S2CID 240152854 .
- ↑ Steel, Adam; Billings, Madeleine M.; Silson, Edward H.; Robertson, Caroline E. (2021-05-11). "Una red que vincula la percepción de escenas y los sistemas de memoria espacial en la corteza cerebral posterior" . Nature Communications . 12 (1): 2632. Bibcode : 2021NatCo..12.2632S . doi : 10.1038/s41467-021-22848- z . ISSN 2041-1723 . PMC 8113503. PMID 33976141 .
- ↑ Cepelewicz, Jordana (2022-02-08). "Nuevo mapa de significado en el cerebro cambia las ideas sobre la memoria" . Quanta Magazine . Recuperado el 2022-02-16 .
- Lingüística computacional
- Procesamiento del lenguaje natural
- Semántica
- Aprendizaje automático