
La comprensión del lenguaje natural ( NLU ) o interpretación del lenguaje natural ( NLI ) [ 1 ] es un subconjunto del procesamiento del lenguaje natural en inteligencia artificial que se ocupa de la comprensión lectora automática . La NLU se ha considerado un problema difícil para la IA . [ 2 ]
Existe un considerable interés comercial en el campo debido a su aplicación al razonamiento automatizado , [ 3 ] traducción automática , [ 4 ] respuesta a preguntas , [ 5 ] recopilación de noticias, categorización de texto , activación por voz , archivado y análisis de contenido a gran escala .
Historia
El programa STUDENT , escrito en 1964 por Daniel Bobrow para su tesis doctoral en el MIT , es uno de los primeros intentos conocidos de NLU por parte de una computadora. [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] Ocho años después de que John McCarthy acuñara el término inteligencia artificial , la tesis de Bobrow (titulada Entrada de lenguaje natural para un sistema de resolución de problemas informáticos ) mostró cómo una computadora podía comprender entradas simples de lenguaje natural para resolver problemas verbales de álgebra.
Un año después, en 1965, Joseph Weizenbaum, del MIT, escribió ELIZA , un programa interactivo que mantenía un diálogo en inglés sobre cualquier tema, siendo la psicoterapia el más popular. ELIZA funcionaba mediante un sencillo análisis sintáctico y la sustitución de palabras clave por frases predefinidas, y Weizenbaum evitó el problema de dotar al programa de una base de datos con conocimiento del mundo real o un léxico extenso . Sin embargo, ELIZA alcanzó una sorprendente popularidad como proyecto experimental y puede considerarse un precursor muy temprano de los sistemas comerciales actuales, como los utilizados por Ask.com . [ 11 ]
En 1969, Roger Schank, de la Universidad de Stanford, introdujo la teoría de la dependencia conceptual para el NLU. [ 12 ] Este modelo, influenciado en parte por el trabajo de Sydney Lamb , fue ampliamente utilizado por los estudiantes de Schank en la Universidad de Yale , como Robert Wilensky , Wendy Lehnert y Janet Kolodner .
En 1970, William A. Woods introdujo la red de transición aumentada (ATN) para representar la entrada de lenguaje natural. [ 13 ] En lugar de reglas de estructura de frases, las ATN utilizaban un conjunto equivalente de autómatas de estados finitos que se invocaban recursivamente. Las ATN y su formato más general, denominado "ATN generalizadas", se siguieron utilizando durante varios años.
En 1971, Terry Winograd terminó de escribir SHRDLU para su tesis doctoral en el MIT. SHRDLU podía entender oraciones simples en inglés en un mundo restringido de bloques infantiles para dirigir un brazo robótico y mover objetos. La exitosa demostración de SHRDLU proporcionó un impulso significativo para la investigación continua en el campo. [ 14 ] [ 15 ] Winograd continuó siendo una influencia importante en el campo con la publicación de su libro El lenguaje como proceso cognitivo . [ 16 ] En Stanford, Winograd asesoraría más tarde a Larry Page , cofundador de Google .
En las décadas de 1970 y 1980, el grupo de procesamiento del lenguaje natural de SRI International continuó la investigación y el desarrollo en este campo. Se emprendieron varios esfuerzos comerciales basados en la investigación; por ejemplo , en 1982, Gary Hendrix fundó Symantec Corporation, originalmente como una empresa para desarrollar una interfaz de lenguaje natural para consultas de bases de datos en computadoras personales. Sin embargo, con la llegada de las interfaces gráficas de usuario controladas por ratón , Symantec cambió de rumbo. Otros esfuerzos comerciales se iniciaron casi al mismo tiempo, por ejemplo , Larry R. Harris en Artificial Intelligence Corporation y Roger Schank y sus estudiantes en Cognitive Systems Corp. [ 17 ] [ 18 ] En 1983, Michael Dyer desarrolló el sistema BORIS en Yale, que presentaba similitudes con el trabajo de Roger Schank y WG Lehnert. [ 19 ]
El tercer milenio vio la introducción de sistemas que utilizaban aprendizaje automático para la clasificación de texto, como IBM Watson . Sin embargo, los expertos debaten cuánta "comprensión" demuestran estos sistemas: por ejemplo , según John Searle , Watson ni siquiera comprendía las preguntas. [ 20 ]
Durante la década de 2010, los sistemas de LNL utilizaron cada vez más incrustaciones de palabras , incluyendo word2vec , que representan palabras como vectores densos aprendidos a partir de grandes colecciones de texto y pueden capturar relaciones sintácticas y semánticas entre palabras. [ 21 ] Posteriormente, los modelos basados en transformadores, como BERT, utilizaron un preentrenamiento a gran escala seguido de un ajuste fino, mejorando el rendimiento en tareas de LNL como la respuesta a preguntas y la inferencia del lenguaje natural. [ 22 ]
John Ball , científico cognitivo e inventor de la Teoría Patom , respalda esta evaluación. El procesamiento del lenguaje natural ha logrado avances en aplicaciones que apoyan la productividad humana en el sector servicios y el comercio electrónico, pero esto ha sido posible en gran medida al limitar el alcance de la aplicación. Existen miles de maneras de solicitar algo en lenguaje humano que aún desafían el procesamiento convencional del lenguaje natural. Según Wibe Wagemans, «Tener una conversación significativa con las máquinas solo es posible cuando relacionamos cada palabra con el significado correcto basándonos en los significados de las demás palabras de la oración, tal como lo hace un niño de 3 años sin adivinar». [ 23 ]
Alcance y contexto
El término general "comprensión del lenguaje natural" puede aplicarse a un conjunto diverso de aplicaciones informáticas, que van desde tareas pequeñas y relativamente simples, como comandos cortos emitidos a robots , hasta proyectos altamente complejos, como la comprensión completa de artículos periodísticos o pasajes poéticos. Muchas aplicaciones del mundo real se sitúan entre los dos extremos; por ejemplo, la clasificación de texto para el análisis automático de correos electrónicos y su enrutamiento al departamento adecuado en una corporación no requiere una comprensión profunda del texto, [ 24 ] pero necesita manejar un vocabulario mucho más amplio y una sintaxis más diversa que la gestión de consultas simples a tablas de bases de datos con esquemas fijos.
A lo largo de los años, se han realizado diversos intentos de procesar lenguaje natural o oraciones similares al inglés presentadas a las computadoras, con distintos grados de complejidad. Algunos intentos no han dado como resultado sistemas con una comprensión profunda, pero han contribuido a la usabilidad general del sistema. Por ejemplo, Wayne Ratliff desarrolló originalmente el programa Vulcan con una sintaxis similar al inglés para imitar a la computadora que hablaba inglés en Star Trek . Vulcan se convirtió posteriormente en el sistema dBase , cuya sintaxis fácil de usar impulsó la industria de las bases de datos para computadoras personales. [ 25 ] [ 26 ] Sin embargo, los sistemas con una sintaxis fácil de usar o similar al inglés son bastante distintos de los sistemas que utilizan un léxico rico e incluyen una representación interna (a menudo como lógica de primer orden ) de la semántica de las oraciones en lenguaje natural.
Por lo tanto, la amplitud y profundidad de la "comprensión" que busca un sistema determinan tanto la complejidad del sistema (y los desafíos implícitos) como los tipos de aplicaciones que puede manejar. La "amplitud" de un sistema se mide por el tamaño de su vocabulario y gramática. La "profundidad" se mide por el grado en que su comprensión se aproxima a la de un hablante nativo fluido. En su nivel más limitado y superficial, los intérpretes de comandos similares al inglés requieren una complejidad mínima, pero tienen un rango de aplicaciones reducido. Los sistemas limitados pero profundos exploran y modelan mecanismos de comprensión, [ 27 ] pero aún tienen una aplicación limitada. Los sistemas que intentan comprender el contenido de un documento, como un comunicado de prensa, más allá de la simple coincidencia de palabras clave y para juzgar su idoneidad para un usuario son más amplios y requieren una complejidad significativa, [ 28 ] pero aún son algo superficiales. Los sistemas que son a la vez muy amplios y muy profundos están más allá del estado del arte actual.
Componentes y arquitectura
Independientemente del enfoque utilizado, la mayoría de los sistemas de comprensión del lenguaje natural (PLN) comparten algunos componentes comunes. El sistema necesita un léxico del idioma, un analizador sintáctico y reglas gramaticales para descomponer las oraciones en una representación interna. La construcción de un léxico extenso con una ontología adecuada requiere un esfuerzo considerable; por ejemplo , el léxico de WordNet requirió muchos años-persona de trabajo. [ 29 ]
El sistema también necesita la teoría de la semántica para guiar la comprensión. Las capacidades de interpretación de un sistema de comprensión del lenguaje dependen de la teoría semántica que utiliza. Las teorías semánticas del lenguaje en competencia tienen ventajas y desventajas específicas en cuanto a su idoneidad como base de la interpretación semántica automatizada por computadora. [ 30 ] Estas van desde la semántica ingenua o el análisis semántico estocástico hasta el uso de la pragmática para derivar significado del contexto. [ 31 ] [ 32 ] [ 33 ] Los analizadores semánticos convierten textos en lenguaje natural en representaciones formales de significado. [ 34 ]
Las aplicaciones avanzadas de la comprensión del lenguaje natural (PLN) también intentan incorporar la inferencia lógica dentro de su marco. Esto generalmente se logra mapeando el significado derivado en un conjunto de aserciones en lógica de predicados , y luego utilizando la deducción lógica para llegar a conclusiones. Por lo tanto, los sistemas basados en lenguajes funcionales como Lisp necesitan incluir un subsistema para representar aserciones lógicas, mientras que los sistemas orientados a la lógica, como los que utilizan el lenguaje Prolog , generalmente se basan en una extensión del marco de representación lógica integrado. [ 35 ] [ 36 ]
La gestión del contexto en el procesamiento del lenguaje natural (PLN) puede presentar desafíos especiales. Una gran variedad de ejemplos y contraejemplos han dado lugar a múltiples enfoques para el modelado formal del contexto, cada uno con fortalezas y debilidades específicas. [ 37 ] [ 38 ]
Véase también
- Semántica computacional
- Lingüística computacional
- Teoría de la representación del discurso
- Procesamiento lingüístico profundo
- Historia del procesamiento del lenguaje natural
- Extracción de información
- Mathematica [ 39 ] [ 40 ] [ 41 ]
- Generación de lenguaje natural
- Procesamiento del lenguaje natural
- Programación en lenguaje natural
- Interfaz de usuario en lenguaje natural
- Extracción de información abierta
- Etiquetado de partes de la oración
- Reconocimiento de voz
Referencias
- ↑ Semaan, P. (2012). Generación de lenguaje natural: una visión general . Journal of Computer Science & Research (JCSCR)-ISSN, 50-57
- ↑ Roman V. Yampolskiy. La prueba de Turing como característica definitoria de la completitud de la IA. En Inteligencia artificial, computación evolutiva y metaheurísticas (AIECM) --Tras los pasos de Alan Turing. Xin-She Yang (Ed.). págs. 3-17. (Capítulo 1). Springer, Londres. 2013. http://cecs.louisville.edu/ry/TuringTestasaDefiningFeature04270003.pdf Archivado el 22 de mayo de 2013 en Wayback Machine.
- ^ Van Harmelen, Frank, Vladimir Lifschitz y Bruce Porter, eds. Manual de representación del conocimiento . vol. 1. Elsevier, 2008.
- ↑ Macherey, Klaus, Franz Josef Och y Hermann Ney. « Comprensión del lenguaje natural mediante traducción automática estadística ». Séptima Conferencia Europea sobre Comunicación y Tecnología del Habla. 2001.
- ↑ Hirschman, Lynette y Robert Gaizauskas. " Respuesta a preguntas en lenguaje natural: la perspectiva desde aquí ". Ingeniería del lenguaje natural 7.4 (2001): 275-300.
- ↑ Asociación Estadounidense para la Inteligencia Artificial - Breve historia de la IA
- ↑ Tesis doctoral de Daniel Bobrow : Entrada de lenguaje natural para un sistema informático de resolución de problemas .
- ↑ Máquinas que piensan, de Pamela McCorduck, 2004 ISBN 1-56881-205-1página 286
- ↑ Russell, Stuart J.; Norvig, Peter (2003), Inteligencia artificial: un enfoque moderno Prentice Hall, ISBN 0-13-790395-2, http://aima.cs.berkeley.edu/ , pág. 19
- ↑ Estilo de logotipo de informática: Más allá de la programación por Brian Harvey 1997 ISBN 0-262-58150-7página 278
- ↑ Weizenbaum, Joseph (1976). El poder de la computadora y la razón humana: del juicio al cálculo. WH Freeman and Company. ISBN 0-7167-0463-3páginas 188-189
- ↑ Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
- ↑ Woods, William A (1970). "Gramáticas de redes de transición para el análisis del lenguaje natural". Communications of the ACM 13 (10): 591–606
- ↑ Inteligencia artificial: conceptos críticos , Volumen 1 por Ronald Chrisley, Sander Begeer 2000 ISBN 0-415-19332-Xpágina 89
- ↑ Página de Terry Winograd en SHRDLU de Stanford. Archivada el 17 de agosto de 2020 en Wayback Machine.
- ↑ Winograd, Terry (1983), El lenguaje como proceso cognitivo , Addison–Wesley, Reading, MA.
- ↑ Larry R. Harris, Investigación en la corporación de Inteligencia Artificial. Boletín ACM SIGART, número 79, enero de 1982
- ↑ Dentro del razonamiento basado en casos por Christopher K. Riesbeck, Roger C. Schank 1989 ISBN 0-89859-767-6página xiii
- ↑ Comprensión profunda: Un modelo de proceso integrado para la comprensión narrativa. Michael G. Dyer. MIT Press. ISBN 0-262-04073-5
- ↑ Searle, John (23 de febrero de 2011). "Watson no sabe que ganó en 'Jeopardy!'"" . Wall Street Journal .
- ↑ Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013). "Estimación eficiente de representaciones de palabras en el espacio vectorial". arXiv : 1301.3781 [ cs.CL ].
- ↑ Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2019). BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje . Actas de NAACL-HLT 2019. págs. 4171–4186 . doi : 10.18653/v1/N19-1423 .
- ↑ Brandon, John (12 de julio de 2016). "Qué significa la tecnología de comprensión del lenguaje natural para los chatbots" . VentureBeat . Recuperado el 29 de febrero de 2024 .
- ^ Un enfoque para la categorización jerárquica del correo electrónico por Peifeng Li et al. en Procesamiento del lenguaje natural y sistemas de información editado por Zoubida Kedad, Nadira Lammari 2007 ISBN 3-540-73350-7
- ↑ InfoWorld , 13 de noviembre de 1989, página 144
- ↑ InfoWorld , 19 de abril de 1984, página 71
- ↑ Construyendo modelos funcionales de comprensión completa del lenguaje natural en dominios pragmáticos limitados por James Mason 2010
- ↑ Minería de la web: descubrimiento de conocimiento a partir de datos de hipertexto por Soumen Chakrabarti 2002 ISBN 1-55860-754-4página 289
- ↑ GA Miller, R. Beckwith, CD Fellbaum, D. Gross, K. Miller. 1990. WordNet: Una base de datos léxica en línea . Int. J. Lexicograph. 3, 4, pp. 235-244.
- ↑ Uso de ordenadores en lingüística: una guía práctica por John Lawler, Helen Aristar Dry 198 ISBN 0-415-16792-2página 209
- ↑ Semántica ingenua para la comprensión del lenguaje natural por Kathleen Dahlgren 1988 ISBN 0-89838-287-4
- ↑ Análisis semántico basado en estocástica por Wolfgang Minker, Alex Waibel , Joseph Mariani 1999 ISBN 0-7923-8571-3
- ↑ Pragmática y comprensión del lenguaje natural por Georgia M. Green 1996 ISBN 0-8058-2166-X
- ↑ Wong, Yuk Wah y Raymond J. Mooney . « Aprendizaje para el análisis semántico con traducción automática estadística ». Actas de la conferencia principal sobre tecnología del lenguaje humano del capítulo norteamericano de la Asociación de Lingüística Computacional. Asociación de Lingüística Computacional, 2006.
- ↑ Procesamiento del lenguaje natural para programadores de Prolog por M. Covington, 1994 ISBN 0-13-629478-2
- ↑ Procesamiento del lenguaje natural en Prolog por Gerald Gazdar, Christopher S. Mellish 1989 ISBN 0-201-18053-7
- ↑ Comprender la comprensión del lenguaje por Ashwin Ram, Kenneth Moorman 1999 ISBN 0-262-18192-4página 111
- ↑ Aspectos formales del contexto por Pierre Bonzon et al. 2000 ISBN 0-7923-6350-7
- ↑ La programación con lenguaje natural realmente va a funcionar — Blog de Wolfram
- ^ Van Valin, Jr, Robert D. "De la PNL a la NLU" (PDF) .
- ↑ Ball, John. " NLU multilingüe de Pat Inc" . Pat.ai.
- Procesamiento del lenguaje natural