El procesamiento del lenguaje natural es la actividad informática que utiliza ordenadores para analizar, comprender , modificar o generar lenguaje natural . Esto incluye la automatización de cualquier forma, actividad o método de comunicación lingüística, como la conversación , la correspondencia, la lectura , la redacción , el dictado , la publicación , la traducción , la lectura de labios , etc. El procesamiento del lenguaje natural también se refiere a la rama de la informática , la inteligencia artificial y la lingüística que se ocupa de capacitar a los ordenadores para comunicarse mediante el lenguaje natural en todas sus formas, incluyendo, entre otras, el habla , la impresión , la escritura y el lenguaje de señas . El siguiente esquema ofrece una visión general y una guía temática sobre el procesamiento del lenguaje natural:
Procesamiento del lenguaje natural
El procesamiento del lenguaje natural se puede describir como todo lo siguiente:
- Un campo de la ciencia : una empresa sistemática que construye y organiza el conocimiento en forma de explicaciones y predicciones comprobables sobre el universo. [ 1 ]
- Una ciencia aplicada : campo que aplica el conocimiento humano para construir o diseñar cosas útiles.
- Un campo de la informática : el enfoque científico y práctico de la computación y sus aplicaciones.
- Una rama de la inteligencia artificial : la inteligencia de las máquinas y los robots, y la rama de la informática que tiene como objetivo crearla.
- Un subcampo de la lingüística computacional : un campo interdisciplinario que se ocupa del modelado estadístico o basado en reglas del lenguaje natural desde una perspectiva computacional.
- Un campo de la informática : el enfoque científico y práctico de la computación y sus aplicaciones.
- Aplicación de la ingeniería : ciencia, habilidad y profesión de adquirir y aplicar conocimientos científicos, económicos, sociales y prácticos, con el fin de diseñar y construir estructuras, máquinas, dispositivos, sistemas, materiales y procesos.
- Una aplicación de la ingeniería de software : aplicación de un enfoque sistemático, disciplinado y cuantificable al diseño, desarrollo, operación y mantenimiento de software, y el estudio de estos enfoques; es decir, la aplicación de la ingeniería al software. [ 2 ] [ 3 ] [ 4 ]
- La programación es un subcampo de la programación informática que consiste en diseñar, escribir, probar, depurar y mantener el código fuente de los programas. Este código fuente se escribe en uno o más lenguajes de programación (como Java, C++, C#, Python, etc.). El objetivo de la programación es crear un conjunto de instrucciones que las computadoras utilizan para realizar operaciones específicas o para mostrar los comportamientos deseados.
- Un subcampo de la programación de inteligencia artificial –
- La programación es un subcampo de la programación informática que consiste en diseñar, escribir, probar, depurar y mantener el código fuente de los programas. Este código fuente se escribe en uno o más lenguajes de programación (como Java, C++, C#, Python, etc.). El objetivo de la programación es crear un conjunto de instrucciones que las computadoras utilizan para realizar operaciones específicas o para mostrar los comportamientos deseados.
- Una aplicación de la ingeniería de software : aplicación de un enfoque sistemático, disciplinado y cuantificable al diseño, desarrollo, operación y mantenimiento de software, y el estudio de estos enfoques; es decir, la aplicación de la ingeniería al software. [ 2 ] [ 3 ] [ 4 ]
- Una ciencia aplicada : campo que aplica el conocimiento humano para construir o diseñar cosas útiles.
- Un tipo de sistema : conjunto de componentes que interactúan o son interdependientes y que forman un todo integrado o un conjunto de elementos (a menudo llamados "componentes") y relaciones que son diferentes de las relaciones del conjunto o sus elementos con otros elementos o conjuntos.
- Un sistema que incluye software : el software es un conjunto de programas informáticos y datos relacionados que proporcionan las instrucciones para indicarle a una computadora qué hacer y cómo hacerlo. El software se refiere a uno o más programas informáticos y datos almacenados en la memoria de la computadora. En otras palabras, el software es un conjunto de programas, procedimientos, algoritmos y su documentación relacionados con el funcionamiento de un sistema de procesamiento de datos.
- Un tipo de tecnología : la creación, modificación, uso y conocimiento de herramientas, máquinas, técnicas, oficios, sistemas y métodos de organización, con el fin de resolver un problema, mejorar una solución preexistente, alcanzar un objetivo, gestionar una relación de entrada/salida o realizar una función específica. También puede referirse al conjunto de dichas herramientas, maquinaria, modificaciones, disposiciones y procedimientos. Las tecnologías influyen significativamente en la capacidad de los seres humanos y de otras especies animales para controlar y adaptarse a sus entornos naturales.
- Una forma de tecnología informática : las computadoras y sus aplicaciones. El PLN utiliza computadoras, escáneres de imágenes, micrófonos y muchos tipos de programas informáticos.
- La tecnología del lenguaje comprende, por un lado, el procesamiento del lenguaje natural (PLN) y la lingüística computacional (LC), y por otro, la tecnología del habla. También incluye muchos aspectos aplicados de estas disciplinas. A menudo se la denomina tecnología del lenguaje humano (TLH).
- Una forma de tecnología informática : las computadoras y sus aplicaciones. El PLN utiliza computadoras, escáneres de imágenes, micrófonos y muchos tipos de programas informáticos.
Tecnologías prerrequisito
Las siguientes tecnologías hacen posible el procesamiento del lenguaje natural:
- Comunicación : la actividad de una fuente que envía un mensaje a un receptor.
- Idioma -
- Informática –
- Computadoras –
- Programación informática –
- Software -
- Edición de texto : programa utilizado para editar archivos de texto plano.
- Procesamiento de textos : programa informático utilizado para componer, editar, formatear e imprimir documentos.
- Dispositivos de entrada : piezas de hardware para enviar datos a una computadora para su procesamiento [ 5 ].
- Teclado de ordenador : dispositivo de entrada similar a una máquina de escribir cuya entrada se convierte en diversos datos según las circunstancias.
- Escáneres de imágenes –
Subcampos del procesamiento del lenguaje natural
- Extracción de información (EI) : campo que se ocupa en general de la extracción de información semántica de un texto. Esto abarca tareas como el reconocimiento de entidades nombradas , la resolución de correferencias , la extracción de relaciones , etc.
- Ingeniería de ontologías : campo que estudia los métodos y metodologías para construir ontologías, que son representaciones formales de un conjunto de conceptos dentro de un dominio y las relaciones entre esos conceptos.
- Procesamiento del habla : campo que abarca el reconocimiento del habla , la conversión de texto a voz y tareas relacionadas.
- Procesamiento estadístico del lenguaje natural –
- Semántica estadística : un subcampo de la semántica computacional que establece relaciones semánticas entre palabras para examinar sus contextos.
- Semántica distribucional : un subcampo de la semántica estadística que examina la relación semántica de las palabras en un corpus o en grandes muestras de datos.
- Semántica estadística : un subcampo de la semántica computacional que establece relaciones semánticas entre palabras para examinar sus contextos.
Campos relacionados
El procesamiento del lenguaje natural contribuye a los siguientes campos y hace uso de ellos (de las teorías, herramientas y metodologías):
- El razonamiento automatizado es un área de la informática y la lógica matemática dedicada a comprender diversos aspectos del razonamiento y a desarrollar software que permita a las computadoras razonar de forma completamente automática, o casi completamente automática. Como subcampo de la inteligencia artificial, el razonamiento automatizado también se fundamenta en la informática teórica y la filosofía de la mente.
- Lingüística : estudio científico del lenguaje humano. El procesamiento del lenguaje natural requiere comprender la estructura y la aplicación del lenguaje, por lo que se basa en gran medida en la lingüística.
- Lingüística aplicada : campo de estudio interdisciplinario que identifica, investiga y ofrece soluciones a problemas reales relacionados con el lenguaje. Algunos de los campos académicos relacionados con la lingüística aplicada son la educación, la lingüística, la psicología, la informática, la antropología y la sociología. Algunos de los subcampos de la lingüística aplicada relevantes para el procesamiento del lenguaje natural son:
- Bilingüismo / Multilingüismo –
- Comunicación mediada por computadora (CMC) : cualquier transacción comunicativa que se produce mediante el uso de dos o más computadoras en red. [ 6 ] La investigación sobre CMC se centra principalmente en los efectos sociales de las diferentes tecnologías de comunicación asistidas por computadora. Muchos estudios recientes involucran redes sociales basadas en Internet apoyadas por software social .
- Lingüística contrastiva : enfoque lingüístico orientado a la práctica que busca describir las diferencias y similitudes entre un par de lenguas.
- Análisis de la conversación (AC) : enfoque para el estudio de la interacción social, que abarca tanto la conducta verbal como la no verbal, en situaciones de la vida cotidiana. La alternancia de turnos es un aspecto del uso del lenguaje que se estudia mediante el AC.
- Análisis del discurso : diversos enfoques para analizar el uso del lenguaje escrito, oral o de señas, o cualquier evento semiótico significativo.
- Lingüística forense : aplicación del conocimiento, los métodos y las perspectivas lingüísticas al contexto forense del derecho, el lenguaje, la investigación criminal, los juicios y los procedimientos judiciales.
- Interlingüística : estudio de la mejora de la comunicación entre personas con diferentes lenguas maternas mediante el uso de lenguas étnicas y auxiliares (lingua franca). Por ejemplo, mediante el uso de lenguas auxiliares internacionales intencionadas, como el esperanto o la interlingua, o interlenguas espontáneas conocidas como lenguas pidgin.
- Evaluación lingüística : evaluación de la primera, segunda u otra lengua en el contexto escolar, universitario o de enseñanza superior; evaluación del uso del idioma en el ámbito laboral; y evaluación del idioma en los contextos de inmigración, ciudadanía y asilo. La evaluación puede incluir análisis de la comprensión auditiva, oral, lectora, escrita o cultural, con respecto a la comprensión del funcionamiento teórico del idioma y la capacidad de utilizarlo en la práctica.
- Pedagogía lingüística : ciencia y arte de la enseñanza de idiomas, incluyendo enfoques y métodos de enseñanza y estudio de lenguas. El procesamiento del lenguaje natural se utiliza en programas diseñados para la enseñanza de idiomas, incluyendo la formación en primera y segunda lengua.
- Planificación lingüística –
- Política lingüística –
- Lexicografía –
- Alfabetización –
- Pragmática –
- Adquisición de una segunda lengua –
- Estilística –
- Traducción -
- Lingüística computacional : campo interdisciplinario que se ocupa del modelado estadístico o basado en reglas del lenguaje natural desde una perspectiva computacional. Los modelos y herramientas de la lingüística computacional se utilizan ampliamente en el campo del procesamiento del lenguaje natural, y viceversa.
- Semántica computacional –
- Lingüística de corpus : estudio del lenguaje expresado en muestras (corpus) de texto del "mundo real". Corpus es el plural de corpus , y un corpus es una colección de textos (o segmentos de habla) específicamente seleccionados, compuestos de lenguaje natural. Una vez construido (recopilado o compuesto), un corpus se analiza con los métodos de la lingüística computacional para inferir el significado y el contexto de sus componentes (palabras, frases y oraciones), así como las relaciones entre ellos. Opcionalmente, un corpus puede anotarse ("etiquetarse") con datos (manual o automáticamente) para facilitar su comprensión (por ejemplo, etiquetado de partes de la oración ). Estos datos se aplican posteriormente para interpretar la entrada del usuario, por ejemplo, para realizar mejores predicciones (automatizadas) de lo que la gente está diciendo, para lograr búsquedas web más específicas o para el reconocimiento de voz.
- Metalingüística –
- Lingüística de signos : estudio científico y análisis de las lenguas de signos naturales, sus características, su estructura (fonología, morfología, sintaxis y semántica), su adquisición (como lengua primaria o secundaria), cómo se desarrollan independientemente de otras lenguas, su aplicación en la comunicación, sus relaciones con otras lenguas (incluidas las lenguas orales) y muchos otros aspectos.
- Lingüística aplicada : campo de estudio interdisciplinario que identifica, investiga y ofrece soluciones a problemas reales relacionados con el lenguaje. Algunos de los campos académicos relacionados con la lingüística aplicada son la educación, la lingüística, la psicología, la informática, la antropología y la sociología. Algunos de los subcampos de la lingüística aplicada relevantes para el procesamiento del lenguaje natural son:
- La interacción persona-ordenador , que se sitúa en la intersección de la informática y las ciencias del comportamiento, abarca el estudio, la planificación y el diseño de la interacción entre las personas (usuarios) y los ordenadores. Prestar atención a la interacción persona-máquina es fundamental, ya que las interfaces hombre-máquina mal diseñadas pueden provocar numerosos problemas inesperados. Un ejemplo clásico es el accidente de Three Mile Island, donde las investigaciones concluyeron que el diseño de la interfaz hombre-máquina fue, al menos en parte, responsable del desastre.
- Recuperación de información (RI) : campo que se ocupa del almacenamiento, la búsqueda y la recuperación de información. Es un campo independiente dentro de la informática (más cercano a las bases de datos), pero la RI se basa en algunos métodos de PLN (por ejemplo, la lematización). Algunas investigaciones y aplicaciones actuales buscan tender un puente entre la RI y el PLN.
- Representación del conocimiento (RC) : área de investigación en inteligencia artificial que busca representar el conocimiento mediante símbolos para facilitar la inferencia a partir de sus elementos, creando así nuevos elementos de conocimiento. La investigación en representación del conocimiento implica el análisis de cómo razonar con precisión y eficacia, y cómo utilizar de la mejor manera un conjunto de símbolos para representar un conjunto de hechos dentro de un dominio del conocimiento.
- Red semántica : estudio de las relaciones semánticas entre conceptos.
- Aprendizaje automático : subcampo de la informática que examina el reconocimiento de patrones y la teoría del aprendizaje computacional en inteligencia artificial. Existen tres enfoques principales para el aprendizaje automático. El aprendizaje supervisado se produce cuando un tutor proporciona a la máquina ejemplos de entradas y salidas para que aprenda una regla que las relacione con las salidas. El aprendizaje no supervisado se produce cuando la máquina determina la estructura de las entradas sin recibir ejemplos de entradas o salidas. El aprendizaje por refuerzo se produce cuando una máquina debe realizar una tarea sin retroalimentación de un tutor.
- Reconocimiento de patrones : rama del aprendizaje automático que examina cómo las máquinas reconocen regularidades en los datos. Al igual que en el aprendizaje automático, los instructores pueden entrenar a las máquinas para reconocer patrones proporcionándoles ejemplos de entrada y salida (es decir, aprendizaje supervisado ), o las máquinas pueden reconocer patrones sin ser entrenadas con ningún ejemplo de entrada o salida (es decir, aprendizaje no supervisado ).
- Clasificación estadística –
Estructuras utilizadas en el procesamiento del lenguaje natural
- Anáfora : tipo de expresión cuya referencia depende de otro elemento referencial. Por ejemplo, en la oración "Sally prefería la compañía de sí misma", "sí misma" es una expresión anafórica, ya que es correferencial con "Sally", el sujeto de la oración.
- Lenguaje libre de contexto –
- Lenguaje natural controlado : un lenguaje natural con una restricción introducida en su gramática y vocabulario para eliminar la ambigüedad y la complejidad.
- Corpus : conjunto de datos, opcionalmente etiquetados (por ejemplo, mediante el etiquetado de partes de la oración ), que proporciona muestras del mundo real para su análisis y comparación.
- Corpus textual : conjunto extenso y estructurado de textos, que hoy en día suelen almacenarse y procesarse electrónicamente. Se utilizan para realizar análisis estadísticos y pruebas de hipótesis, comprobar ocurrencias o validar reglas lingüísticas dentro de un tema (o dominio ) específico.
- Corpus de voz : base de datos de archivos de audio y transcripciones de texto. En tecnología del habla, los corpus de voz se utilizan, entre otras cosas, para crear modelos acústicos (que luego pueden emplearse con un motor de reconocimiento de voz). En lingüística, los corpus de voz se utilizan para investigar la fonética, el análisis de la conversación, la dialectología y otros campos.
- Gramática -
- Gramática libre de contexto (GLC) –
- Gramática de restricciones (CG) –
- Gramática de cláusulas definidas (DCG) –
- Gramática de unificación funcional (FUG) –
- Gramática de estructura de frases generalizada (GPSG) –
- Gramática de estructura de frases dirigida por la cabeza (HPSG) –
- Gramática léxico-funcional (GLF) –
- Gramática libre de contexto probabilística (PCFG) : otro nombre para la gramática libre de contexto estocástica.
- Gramática estocástica libre de contexto (SCFG) –
- Gramática funcional sistémica (GFS) –
- Gramática de adjunción de árboles (TAG) –
- Lenguaje natural –
- n -grama : secuencia de n elementos, donde un elemento es un carácter, sílaba o palabra. La n se reemplaza por un número. Por lo tanto, un 5-grama es un n- grama de 5 letras, sílabas o palabras. "Eat this" es un 2-grama (también conocido como bigrama).
- Bigrama : n -grama de 2 tokens. Toda secuencia de 2 elementos adyacentes en una cadena de tokens es un bigrama. Los bigramas se utilizan para el reconocimiento de voz, pueden emplearse para resolver criptogramas y la frecuencia de bigramas es un método para la identificación estadística de idiomas.
- Trigrama : caso especial del n- grama, donde n es 3.
- Ontología : representación formal de un conjunto de conceptos dentro de un dominio y las relaciones entre esos conceptos.
- Taxonomía : práctica y ciencia de la clasificación, incluidos los principios que la sustentan y los métodos para clasificar cosas o conceptos.
- Hiponimia e hiperonimia : la lingüística de los hipónimos e hiperónimos. Un hipónimo comparte una relación de tipo con su hiperónimo. Por ejemplo, paloma, cuervo, águila y gaviota son todos hipónimos de ave (su hiperónimo), que, a su vez, es un hipónimo de animal.
- Taxonomía para motores de búsqueda : generalmente denominada "taxonomía de entidades". Se trata de una estructura jerárquica cuyos nodos están etiquetados con entidades que se espera que aparezcan en una consulta de búsqueda web. Estas estructuras se utilizan para relacionar las palabras clave de una consulta de búsqueda con las palabras clave de las respuestas relevantes (o fragmentos).
- Taxonomía : práctica y ciencia de la clasificación, incluidos los principios que la sustentan y los métodos para clasificar cosas o conceptos.
- Implicación textual : relación direccional entre fragmentos de texto. Esta relación se cumple siempre que la veracidad de un fragmento de texto se deriva de otro. En el marco de la Teoría de la Implicación Textual (TE), los textos implicante y derivado se denominan texto (t) e hipótesis (h), respectivamente. La relación es direccional porque, si bien "t implica h", la relación inversa "h implica t" es mucho menos segura.
- Trífono : secuencia de tres fonemas. Los trifonos son útiles en los modelos de procesamiento del lenguaje natural, donde se utilizan para establecer los diversos contextos en los que puede aparecer un fonema en una lengua natural determinada.
Procesos de PLN
Aplicaciones
- La calificación automatizada de ensayos (CAE) consiste en el uso de programas informáticos especializados para asignar calificaciones a ensayos escritos en un contexto educativo. Es un método de evaluación educativa y una aplicación del procesamiento del lenguaje natural. Su objetivo es clasificar un gran conjunto de entidades textuales en un número reducido de categorías discretas, que corresponden a las posibles calificaciones, por ejemplo, del 1 al 6. Por lo tanto, puede considerarse un problema de clasificación estadística.
- Anotación automática de imágenes : proceso mediante el cual un sistema informático asigna automáticamente metadatos textuales, como subtítulos o palabras clave, a una imagen digital. Estas anotaciones se utilizan en sistemas de recuperación de imágenes para organizar y localizar imágenes de interés en una base de datos.
- Generación automática de resúmenes : proceso que consiste en reducir un documento de texto mediante un programa informático para crear un resumen que conserve los puntos más importantes del documento original. Se utiliza a menudo para generar resúmenes de textos de un tipo conocido, como artículos de la sección financiera de un periódico.
- Tipos
- Extracción de palabras clave –
- Resumen del documento –
- Métodos y técnicas
- Resumen basado en extracción –
- Resumen basado en abstracción –
- Resumen basado en la entropía máxima –
- Extracción de oraciones –
- Resumen asistido –
- Resumen de máquina asistido por humanos (HAMS) –
- Resumen humano asistido por máquina (MAHS) –
- Tipos
- Inducción taxonómica automática : construcción automatizada de estructuras arbóreas a partir de un corpus. Esto puede aplicarse a la creación de sistemas de clasificación taxonómica para usuarios finales, como directorios web o esquemas temáticos.
- Resolución de correferencias : para obtener la interpretación correcta de un texto, o incluso para estimar la importancia relativa de los distintos sujetos mencionados, es necesario vincular los pronombres y otras expresiones referenciales con las personas u objetos adecuados. A partir de una oración o un fragmento de texto más extenso, la resolución de correferencias determina qué palabras ("menciones") se refieren a qué objetos ("entidades") incluidos en el texto.
- Resolución de anáforas : se refiere a la correspondencia entre los pronombres y los sustantivos o nombres a los que se refieren. Por ejemplo, en una oración como "Entró en la casa de John por la puerta principal", "la puerta principal" es una expresión referencial y la relación de conexión que se debe identificar es el hecho de que la puerta a la que se hace referencia es la puerta principal de la casa de John (y no la de otra estructura a la que también se podría hacer referencia).
- Sistema de diálogo –
- Programa de ayuda para la lectura en lengua extranjera : programa informático que ayuda a un usuario no nativo a leer correctamente en el idioma que está aprendiendo. Una lectura correcta implica una pronunciación adecuada y la correcta acentuación de las distintas partes de las palabras.
- Ayuda para la escritura en lengua extranjera : programa informático o cualquier otro instrumento que ayude a un hablante no nativo (también conocido como aprendiz de lengua extranjera) a escribir correctamente en la lengua meta. Las herramientas de ayuda se pueden clasificar en dos categorías: indicaciones en tiempo real y revisiones posteriores a la escritura.
- Corrección gramatical : el acto de verificar la corrección gramatical de un texto escrito, especialmente si este acto lo realiza un programa informático .
- Recuperación de información –
- La traducción automática (TA) tiene como objetivo traducir automáticamente texto de un idioma humano a otro. Este es uno de los problemas más difíciles y pertenece a una clase de problemas denominados coloquialmente " completos para la IA ", es decir, que requieren todos los diferentes tipos de conocimiento que poseen los humanos (gramática, semántica, hechos sobre el mundo real, etc.) para resolverse correctamente.
- Enfoque clásico de la traducción automática : traducción automática basada en reglas.
- Traducción asistida por ordenador –
- Traducción automática interactiva –
- Memoria de traducción : base de datos que almacena los llamados "segmentos", que pueden ser oraciones, párrafos o unidades similares a oraciones (encabezados, títulos o elementos de una lista) que se han traducido previamente, con el fin de ayudar a los traductores humanos.
- Traducción automática basada en ejemplos –
- Traducción automática basada en reglas –
- Programación en lenguaje natural : interpretación y compilación de instrucciones comunicadas en lenguaje natural para convertirlas en instrucciones informáticas (código máquina).
- Búsqueda en lenguaje natural –
- Reconocimiento óptico de caracteres (OCR) : dada una imagen que representa texto impreso, determinar el texto correspondiente.
- Responder preguntas : dada una pregunta en lenguaje humano, determinar su respuesta. Las preguntas típicas tienen una respuesta correcta específica (como "¿Cuál es la capital de Canadá?"), pero a veces también se consideran preguntas abiertas (como "¿Cuál es el sentido de la vida?").
- Filtrado de spam –
- El análisis de sentimientos extrae información subjetiva, generalmente de un conjunto de documentos, a menudo utilizando reseñas en línea para determinar la "polaridad" respecto a objetos específicos. Es especialmente útil para identificar tendencias de opinión pública en las redes sociales con fines de marketing.
- Reconocimiento de voz : dado un fragmento de audio de una o varias personas hablando, determinar la representación textual del habla. Esto es lo opuesto a la conversión de texto a voz y es uno de los problemas extremadamente difíciles que coloquialmente se denominan " inteligentes para IA " (véase más arriba). En el habla natural, casi no hay pausas entre palabras sucesivas, por lo que la segmentación del habla es una subtarea necesaria del reconocimiento de voz (véase más abajo). En la mayoría de los idiomas hablados, los sonidos que representan letras sucesivas se fusionan entre sí en un proceso denominado coarticulación , por lo que la conversión de la señal analógica a caracteres discretos puede ser un proceso muy difícil.
- Síntesis de voz (conversión de texto a voz) –
- Corrección de textos –
- Simplificación de texto : edición automatizada de un documento para incluir menos palabras o utilizar palabras más sencillas, conservando al mismo tiempo su significado e información subyacentes.
Procesos de componentes
- La comprensión del lenguaje natural convierte fragmentos de texto en representaciones más formales, como estructuras lógicas de primer orden , que son más fáciles de manipular para los programas informáticos . La comprensión del lenguaje natural implica la identificación de la semántica deseada entre las múltiples semánticas posibles que se pueden derivar de una expresión en lenguaje natural, la cual generalmente adopta la forma de notaciones organizadas de conceptos del lenguaje natural. La introducción y creación de metamodelos y ontologías del lenguaje son soluciones eficientes, aunque empíricas. Para la construcción de una base de formalización semántica, se requiere una formalización explícita de la semántica del lenguaje natural, sin confusiones con supuestos implícitos como el supuesto de mundo cerrado (CWA) frente al supuesto de mundo abierto , o Sí/No subjetivo frente a Verdadero/Falso objetivo. [ 7 ]
- Generación de lenguaje natural : tarea de convertir información de bases de datos informáticas en lenguaje humano legible.
Procesos componentes de la comprensión del lenguaje natural
- Clasificación automática de documentos (categorización de texto) –
- Procesamiento de términos compuestos : categoría de técnicas que identifican términos compuestos y los relacionan con sus definiciones. Los términos compuestos se forman combinando dos (o más) términos simples; por ejemplo, "triple" es un término de una sola palabra, pero "triple bypass cardíaco" es un término compuesto.
- Inducción taxonómica automática –
- Procesamiento de corpus –
- Procesamiento lingüístico profundo –
- El análisis del discurso incluye varias tareas relacionadas. Una de ellas consiste en identificar la estructura discursiva de un texto conectado, es decir, la naturaleza de las relaciones discursivas entre oraciones (por ejemplo, elaboración, explicación, contraste). Otra posible tarea es reconocer y clasificar los actos de habla en un fragmento de texto (por ejemplo, preguntas de sí o no, preguntas de contenido, enunciados, afirmaciones, órdenes, sugerencias, etc.).
- Extracción de información –
- Minería de texto : proceso de obtención de información de alta calidad a partir de texto. Esta información se suele obtener mediante la identificación de patrones y tendencias a través de métodos como el aprendizaje de patrones estadísticos.
- La minería de textos biomédicos ( también conocida como BioNLP) se refiere a la minería de textos aplicada a textos y literatura del ámbito biomédico y de la biología molecular. Es un campo de investigación relativamente reciente que integra elementos del procesamiento del lenguaje natural, la bioinformática, la informática médica y la lingüística computacional. Existe un creciente interés en las estrategias de minería de textos y extracción de información aplicadas a la literatura biomédica y de biología molecular debido al aumento del número de publicaciones disponibles electrónicamente y almacenadas en bases de datos como PubMed.
- Aprendizaje mediante árboles de decisión –
- Extracción de oraciones –
- Extracción de terminología –
- Minería de texto : proceso de obtención de información de alta calidad a partir de texto. Esta información se suele obtener mediante la identificación de patrones y tendencias a través de métodos como el aprendizaje de patrones estadísticos.
- Indexación semántica latente –
- Lematización : agrupa todos los términos semejantes que comparten un mismo lema, de modo que se clasifican como un solo elemento.
- La segmentación morfológica separa las palabras en morfemas individuales e identifica la clase de cada morfema. La dificultad de esta tarea depende en gran medida de la complejidad de la morfología (es decir, la estructura de las palabras) del idioma en cuestión. El inglés tiene una morfología bastante simple, especialmente la flexiva , por lo que a menudo es posible ignorar esta tarea por completo y simplemente modelar todas las formas posibles de una palabra (por ejemplo, "open, opens, opened, opening") como palabras separadas. Sin embargo, en idiomas como el turco , este enfoque no es posible, ya que cada entrada del diccionario tiene miles de formas posibles de palabras.
- El reconocimiento de entidades nombradas (NER, por sus siglas en inglés) , dado un flujo de texto, determina qué elementos del texto se corresponden con nombres propios, como personas o lugares, y cuál es el tipo de cada uno de ellos (p. ej., persona, lugar, organización). Si bien el uso de mayúsculas puede ayudar a reconocer entidades nombradas en idiomas como el inglés, esta información no ayuda a determinar el tipo de entidad nombrada y, en cualquier caso, suele ser imprecisa o insuficiente. Por ejemplo, la primera palabra de una oración también se escribe con mayúscula, y las entidades nombradas a menudo abarcan varias palabras, de las cuales solo algunas se escriben con mayúscula. Además, muchos otros idiomas con escrituras no occidentales (p. ej., chino o árabe ) no tienen mayúsculas, e incluso los idiomas que sí las tienen pueden no utilizarlas de forma consistente para distinguir nombres. Por ejemplo, el alemán escribe con mayúscula todos los sustantivos , independientemente de si se refieren a nombres, y el francés y el español no escriben con mayúscula los nombres que funcionan como adjetivos .
- Aprendizaje de ontologías : creación automática o semiautomática de ontologías , que incluye la extracción de los términos del dominio correspondiente y las relaciones entre esos conceptos a partir de un corpus de texto en lenguaje natural, y su codificación con un lenguaje ontológico para facilitar su recuperación. También se denomina "extracción de ontologías", "generación de ontologías" y "adquisición de ontologías".
- El análisis sintáctico determina el árbol de análisis (análisis gramatical) de una oración dada. La gramática de los lenguajes naturales es ambigua y las oraciones típicas tienen múltiples análisis posibles. De hecho, y quizás sorprendentemente, una oración típica puede tener miles de análisis sintácticos potenciales (la mayoría de los cuales resultarán completamente absurdos para un ser humano).
- Etiquetado de partes de la oración : dada una oración, determina la parte de la oración para cada palabra. Muchas palabras, especialmente las comunes, pueden funcionar como múltiples partes de la oración . Por ejemplo, "libro" puede ser un sustantivo ("el libro sobre la mesa") o un verbo ("reservar un vuelo"); "conjunto" puede ser un sustantivo , verbo o adjetivo ; y "fuera" puede ser cualquiera de al menos cinco partes de la oración diferentes. Algunos idiomas tienen más ambigüedad que otros. Los idiomas con poca morfología flexiva , como el inglés, son particularmente propensos a esta ambigüedad. El chino también es propenso a esta ambigüedad porque es un idioma tonal durante la verbalización. Dicha flexión no se transmite fácilmente a través de las entidades empleadas en la ortografía para expresar el significado deseado.
- Expansión de consulta –
- Extracción de relaciones : a partir de un fragmento de texto, identifica las relaciones entre entidades nombradas (por ejemplo, quién es la esposa de quién).
- Análisis semántico (computacional) : análisis formal del significado, y "computacional" se refiere a enfoques que en principio apoyan una implementación efectiva.
- La segmentación de oraciones (también conocida como desambiguación de límites de oración o detección de oraciones) detecta los límites de las oraciones a partir de un fragmento de texto. Estos límites suelen estar marcados con puntos u otros signos de puntuación , pero estos mismos caracteres pueden tener otras funciones (por ejemplo, marcar abreviaturas ).
- Segmentación de voz : a partir de un fragmento de audio de una o varias personas hablando, lo separa en palabras. Es una subtarea del reconocimiento de voz y normalmente se incluye junto con él.
- Derivación : reduce una palabra flexionada o derivada a su raíz , base o forma fundamental .
- Segmentación de texto –
- Tokenización : dado un fragmento de texto, lo separa en palabras, símbolos, oraciones u otras unidades distintas.
- Segmentación y reconocimiento de temas : dado un fragmento de texto, lo divide en segmentos, cada uno de los cuales está dedicado a un tema, e identifica el tema de cada segmento.
- Truecasing –
- La segmentación de palabras consiste en separar un fragmento de texto continuo en palabras individuales. En un idioma como el inglés, esto es bastante sencillo, ya que las palabras suelen separarse con espacios. Sin embargo, algunos idiomas escritos, como el chino, el japonés y el tailandés, no marcan los límites de las palabras de esta manera, y en esos idiomas la segmentación de texto es una tarea compleja que requiere conocer el vocabulario y la morfología de las palabras.
- Desambiguación del sentido de las palabras (DSP) : dado que muchas palabras tienen más de un significado , la desambiguación del sentido de las palabras se utiliza para seleccionar el significado que tenga más sentido en el contexto. Para este problema, normalmente se nos proporciona una lista de palabras y sus sentidos asociados, por ejemplo, de un diccionario o de un recurso en línea como WordNet .
- La inducción del sentido de las palabras es un problema abierto del procesamiento del lenguaje natural que se refiere a la identificación automática de los sentidos (es decir, los significados) de una palabra. Dado que el resultado de la inducción del sentido de las palabras es un conjunto de sentidos para la palabra objetivo (inventario de sentidos), esta tarea está estrechamente relacionada con la desambiguación del sentido de las palabras (DSP), que se basa en un inventario de sentidos predefinido y tiene como objetivo resolver la ambigüedad de las palabras en contexto.
- Adquisición automática de corpus etiquetados con sentidos –
- W-shingling : conjunto de "shingles" únicos (subsecuencias contiguas de tokens en un documento) que se pueden usar para medir la similitud entre dos documentos. La "w" indica la cantidad de tokens en cada shingle del conjunto.
Procesos componentes de la generación del lenguaje natural
Generación de lenguaje natural : tarea de convertir información de bases de datos informáticas en lenguaje humano legible.
- Inducción automática de taxonomías (ATI) : construcción automatizada de estructuras de árbol a partir de un corpus. Si bien la ATI se utiliza para construir el núcleo de las ontologías (y al hacerlo se convierte en un proceso componente de la comprensión del lenguaje natural), cuando las ontologías que se construyen son legibles para el usuario final (como un esquema temático) y se utilizan para la construcción de documentación adicional (como usar un esquema como base para elaborar un informe o tratado), esto también se convierte en un proceso componente de la generación del lenguaje natural.
- Estructuración de documentos –
Historia del procesamiento del lenguaje natural
Historia del procesamiento del lenguaje natural
- Historia de la traducción automática
- Historia de la calificación automatizada de ensayos
- Historia de la interfaz de usuario en lenguaje natural
- Historia de la comprensión del lenguaje natural
- Historia del reconocimiento óptico de caracteres
- Historia de la respuesta a preguntas
- Historia de la síntesis de voz
- Prueba de Turing : prueba de la capacidad de una máquina para exhibir un comportamiento inteligente, equivalente o indistinguible del de un ser humano. En el ejemplo ilustrativo original, un juez humano conversa en lenguaje natural con otro humano y una máquina diseñada para generar un desempeño indistinguible del humano. Todos los participantes están separados entre sí. Si el juez no puede distinguir con certeza entre la máquina y el humano, se considera que la máquina ha superado la prueba. Alan Turing introdujo la prueba en su artículo de 1950, "Computing Machinery and Intelligence", que comienza con las palabras: "Me propongo considerar la pregunta: '¿Pueden pensar las máquinas?'"
- Gramática universal : teoría lingüística , generalmente atribuida a Noam Chomsky , que propone que la capacidad de aprender gramática está programada en el cerebro. [ 8 ] La teoría sugiere que la habilidad lingüística se manifiesta sin ser enseñada ( véase pobreza del estímulo ) y que existen propiedades que comparten todas las lenguas humanas naturales . Es cuestión de observación y experimentación determinar con precisión qué habilidades son innatas y qué propiedades comparten todas las lenguas.
- ALPAC fue un comité de siete científicos liderado por John R. Pierce, establecido en 1964 por el gobierno estadounidense para evaluar el progreso de la lingüística computacional en general y la traducción automática en particular. Su informe, publicado en 1966, se hizo famoso por su escepticismo hacia la investigación realizada hasta entonces en traducción automática y por enfatizar la necesidad de investigación básica en lingüística computacional; esto provocó que el gobierno estadounidense redujera drásticamente su financiación para este campo.
- Teoría de la dependencia conceptual : un modelo de comprensión del lenguaje natural utilizado en sistemas de inteligencia artificial. Roger Schank, de la Universidad de Stanford, introdujo este modelo en 1969, en los albores de la inteligencia artificial. [ 9 ] Este modelo fue ampliamente utilizado por los estudiantes de Schank en la Universidad de Yale, como Robert Wilensky, Wendy Lehnert y Janet Kolodner.
- Red de transición aumentada : tipo de estructura de teoría de grafos utilizada en la definición operacional de lenguajes formales, especialmente en el análisis sintáctico de lenguajes naturales relativamente complejos, y con amplia aplicación en inteligencia artificial. Introducida por William A. Woods en 1970.
- Traducción de idiomas distribuida (proyecto) –
Cronología del software de PNL
Conceptos generales de procesamiento del lenguaje natural
- El algoritmo de Sukhotin es un algoritmo de clasificación estadística que permite clasificar los caracteres de un texto como vocales o consonantes. Fue creado inicialmente por Boris V. Sukhotin.
- T9 (texto predictivo) , que significa "Texto en 9 teclas", es una tecnología de texto predictivo patentada en EE. UU. para teléfonos móviles (específicamente aquellos que contienen un teclado numérico de 3x4), desarrollada originalmente por Tegic Communications, ahora parte de Nuance Communications.
- Tatoeba : base de datos online gratuita y colaborativa de ejemplos de frases, dirigida a estudiantes de idiomas extranjeros.
- Teragram Corporation , filial de SAS Institute, importante productor de software de análisis estadístico, tiene su sede en Cary, Carolina del Norte, EE. UU. Teragram, con sede en Cambridge, Massachusetts, se especializa en la aplicación de la lingüística computacional al procesamiento del lenguaje natural multilingüe.
- TipTop Technologies es la empresa que desarrolló TipTop Search, un motor de búsqueda web social en tiempo real con una plataforma única para el análisis semántico del lenguaje natural. TipTop Search ofrece resultados que capturan el sentimiento, las opiniones y las experiencias individuales y grupales a partir de diversos tipos de contenido, incluidos mensajes en tiempo real de Twitter o reseñas de productos de consumidores en Amazon.com.
- Búsqueda transderivacional : se realiza una búsqueda de coincidencia aproximada en un campo amplio. En computación, la función equivalente se puede realizar utilizando memoria direccionable por contenido.
- Discrepancia de vocabulario : fenómeno común en el uso de lenguas naturales, que ocurre cuando diferentes personas nombran la misma cosa o concepto de manera diferente.
- Mapa LRE –
- Reificación (lingüística) –
- Web semántica –
- Sistema de diálogo hablado –
- Gramática de afijos sobre un retículo finito –
- Agregación (lingüística) –
- Modelo de bolsa de palabras : modelo que representa un texto como una bolsa (multiconjunto) de sus palabras, sin tener en cuenta la gramática ni la secuencia de palabras, pero manteniendo la multiplicidad. Este modelo se utiliza comúnmente para entrenar clasificadores de documentos.
- Etiquetador brillante –
- Modelo de lenguaje de caché –
- ChaSen y MeCab proporcionan análisis morfológico y división de palabras para el japonés.
- WSD monolingüe clásico –
- Bosque libre –
- El Diccionario de Pronunciación de CMU , también conocido como cmudict , es un diccionario de pronunciación de dominio público diseñado para su uso en tecnología del habla y fue creado por la Universidad Carnegie Mellon (CMU). Define una correspondencia entre las palabras en inglés y sus pronunciaciones en Norteamérica, y se utiliza comúnmente en aplicaciones de procesamiento del habla como el Sistema de Síntesis de Voz Festival y el sistema de reconocimiento de voz CMU Sphinx .
- Minería de conceptos –
- Determinación del contenido –
- DATR –
- DBpedia Spotlight –
- Procesamiento lingüístico profundo –
- Relación discursiva –
- Matriz documento-término –
- Dragomir R. Radev –
- ETBLAST –
- Red de transición recursiva con filtrado y extracción de filtros –
- Robby Garner –
- GeneRIF –
- Dirección de Gorn –
- Inducción gramatical –
- Gramática –
- Truco de hashing –
- Modelo oculto de Markov –
- Tecnología del lenguaje humano –
- Extracción de información –
- Conferencia Internacional sobre Recursos y Evaluación del Lenguaje –
- Estrella Kleene –
- Corporación de Computación de Idiomas –
- Modelo de lenguaje –
- LanguageWare –
- Mapeo semántico latente –
- Recuperación de información legal –
- Algoritmo de Lesk –
- Tecnologías Lessac –
- Lexalytics –
- Elección léxica –
- Marco de marcado léxico –
- Sustitución léxica –
- LKB –
- Forma lógica –
- Mapa LRE –
- Usabilidad del software de traducción automática –
- MAREC –
- Entropía máxima –
- Conferencia sobre la comprensión del mensaje –
- METEORO –
- Semántica de recursión mínima –
- Patrón morfológico –
- Resumen de múltiples documentos –
- Notación multilingüe –
- Semántica ingenua –
- Lenguaje natural –
- Interfaz de lenguaje natural –
- Interfaz de usuario en lenguaje natural –
- Análisis de noticias –
- Polinomio no determinista –
- Sistema de respuesta a preguntas de dominio abierto –
- Teoría de la optimalidad –
- Paco Nathan –
- Gramática de la estructura de las frases –
- Powerset (empresa) –
- Producción (informática) –
- PropBank –
- Responder a preguntas –
- Realización (lingüística) –
- Red de transición recursiva –
- Generación de expresiones de referencia –
- Regla de reescritura –
- Compresión semántica –
- Red neuronal semántica –
- SemEval –
- Notación SPL –
- Derivación : reduce una palabra flexionada o derivada a su raíz , base o forma fundamental .
- Núcleo de cadena –
Herramientas de procesamiento del lenguaje natural
- Google Ngram Viewer : grafica el uso de n -gramas a partir de un corpus de más de 5,2 millones de libros.
Cuerpos
- Corpus textual (véase la lista ) : conjunto extenso y estructurado de textos (actualmente, generalmente almacenados y procesados electrónicamente). Se utilizan para realizar análisis estadísticos y pruebas de hipótesis, verificar ocurrencias o validar reglas lingüísticas dentro de un territorio lingüístico específico.
Kits de herramientas para el procesamiento del lenguaje natural
Los siguientes conjuntos de herramientas de procesamiento del lenguaje natural son colecciones destacadas de software para este fin. Se trata de conjuntos de bibliotecas , marcos de trabajo y aplicaciones para el procesamiento simbólico, estadístico y del habla.
Reconocedores de entidades nombradas
- ABNER (A Biomedical Named-Entity Recognizer) es un programa de minería de texto de código abierto que utiliza modelos de secuencias de campos aleatorios condicionales de cadena lineal. Etiqueta automáticamente genes, proteínas y otros nombres de entidades en el texto. Fue desarrollado por Burr Settles de la Universidad de Wisconsin-Madison.
- Stanford NER (Reconocedor de Entidades Nombradas): Implementación en Java de un reconocedor de entidades nombradas que utiliza modelos de secuencias de campos aleatorios condicionales de cadena lineal. Etiqueta automáticamente personas, organizaciones y ubicaciones en textos en inglés, alemán, chino y español. Desarrollado por Jenny Finkel y otros miembros del Grupo de Procesamiento del Lenguaje Natural de Stanford en la Universidad de Stanford.
Software de traducción
- Comparación de aplicaciones de traducción automática
- Aplicaciones de traducción automática
- Google Translate
- DeepL
- Linguee es un servicio web que ofrece un diccionario en línea para varios pares de idiomas. A diferencia de servicios similares, como LEO, Linguee incorpora un motor de búsqueda que proporciona acceso a una gran cantidad de pares de oraciones bilingües traducidas, procedentes de la World Wide Web. Como herramienta de traducción, Linguee se diferencia de los servicios de traducción automática como Babelfish y su funcionamiento se asemeja más al de una memoria de traducción.
- Lenguaje de Redes Universal de la UNL
- Yahoo! Babel Fish
- Reverso
Otro software
- CTAKES es un sistema de procesamiento del lenguaje natural de código abierto para la extracción de información de texto libre clínico en historias clínicas electrónicas. Procesa notas clínicas, identificando tipos de entidades clínicas con nombre: fármacos, enfermedades/trastornos, signos/síntomas, localizaciones anatómicas y procedimientos. Cada entidad con nombre tiene atributos para el segmento de texto, el código de mapeo de ontología, el contexto (antecedentes familiares, actual, no relacionado con el paciente) y si está negada o no. También conocido como Apache cTAKES.
- DMAP –
- ETAP-3 : sistema de procesamiento lingüístico propietario centrado en inglés y ruso. [ 12 ] Es un sistema basado en reglas que utiliza la Teoría del Significado-Texto como su fundamento teórico.
- JAPE ( Java Annotation Patterns Engine) es un componente de la plataforma de código abierto GATE (General Architecture for Text Engineering). JAPE es un transductor de estados finitos que opera sobre anotaciones basadas en expresiones regulares.
- LOLITA – «Interactor, traductor y analizador lingüístico a gran escala basado en objetos». LOLITA fue desarrollado por Roberto Garigliano y sus colegas entre 1986 y 2000. Fue diseñado como una herramienta de propósito general para procesar texto sin restricciones, que podría servir de base para una amplia variedad de aplicaciones. Su núcleo era una red semántica que contenía unos 90 000 conceptos interconectados.
- Maluuba es un asistente personal inteligente para dispositivos Android que utiliza un enfoque contextual para la búsqueda, teniendo en cuenta la ubicación geográfica, los contactos y el idioma del usuario.
- METAL MT : sistema de traducción automática desarrollado en la década de 1980 en la Universidad de Texas y en Siemens, que funcionaba con máquinas Lisp.
- Aprendizaje de lenguajes sin fin (NELL ): sistema de aprendizaje automático semántico desarrollado por un equipo de investigación de la Universidad Carnegie Mellon y financiado por subvenciones de DARPA, Google y la NSF, con partes del sistema ejecutándose en un clúster de supercomputación proporcionado por Yahoo!. [ 13 ] NELL fue programado por sus desarrolladores para poder identificar un conjunto básico de relaciones semánticas fundamentales entre unos cientos de categorías de datos predefinidas, como ciudades, empresas, emociones y equipos deportivos. Desde principios de 2010, el equipo de investigación de Carnegie Mellon ha estado ejecutando NELL las 24 horas del día, analizando cientos de millones de páginas web en busca de conexiones entre la información que ya conoce y la que encuentra a través de su proceso de búsqueda, para crear nuevas conexiones de una manera que pretende imitar la forma en que los humanos aprenden nueva información. [ 14 ]
- NLTK –
- Traductor-en-línea.com –
- Regulus Grammar Compiler : sistema de software para compilar gramáticas de unificación en gramáticas para sistemas de reconocimiento de voz.
- Voz S –
- Siri (software) –
- Habla con él –
- TeLQAS –
- Herramientas de clasificación de Weka –
- word2vec : modelos desarrollados por un equipo de investigadores liderado por Thomas Milkov en Google para generar incrustaciones de palabras que pueden reconstruir parte del contexto lingüístico de las palabras utilizando redes neuronales bidimensionales poco profundas derivadas de un espacio vectorial mucho mayor.
- Sistema de síntesis de voz para festivales –
- Sistema de reconocimiento de voz CMU Sphinx –
Chatterbots
Chatterbot : un agente conversacional basado en texto que puede interactuar con usuarios humanos a través de algún medio, como un servicio de mensajería instantánea . Algunos chatterbots están diseñados para propósitos específicos, mientras que otros conversan con usuarios humanos sobre una amplia gama de temas.
Chatbots clásicos
- Dr. Sbaitso
- ELIZA
- PARAR
- Racter (o Claude Chatterbot)
- Mark V Shaney
Chatbots generales
- Albert One – Ganador del premio Loebner en 1998 y 1999 , por Robby Garner .
- ALICE , ganador del premio Loebner en 2001, 2002 y 2004, fue desarrollado por Richard Wallace .
- Charlix
- Cleverbot (ganador del Concurso de Inteligencia Mecánica de 2010)
- Elbot – Ganador del Premio Loebner 2008 , por Fred Roberts .
- Eugene Goostman – ganador de las Turing 100 2012, por Vladimir Veselov .
- Fred , uno de los primeros chatbots creados por Robby Garner .
- Jabberwacky
- Jeeney IA
- MegaHAL
- Mitsuku , ganador del Premio Loebner en 2013 y 2016 [ 15 ]
- Rosa - ... 2015 - Ganadora de 3 premios Loebner , por Bruce Wilcox .
- SimSimi : un popular programa de conversación con inteligencia artificial creado en 2002 por ISMaker.
- Spookitalk : un chatbot utilizado para los personajes no jugables (NPC) en el videojuego Starship Titanic de Douglas Adams .
- Ultra Hal – Ganadora del Premio Loebner 2007 , de Robert Medeksza .
- Verbot
Chatbots de mensajería instantánea
- GooglyMinotaur , especializado en Radiohead , el primer bot lanzado por ActiveBuddy (junio de 2001-marzo de 2002) [ 16 ]
- SmarterChild , desarrollado por ActiveBuddy y lanzado en junio de 2001 [ 17 ]
- Infobot , un asistente en canales de IRC como #perl , principalmente para ayudar a responder preguntas frecuentes (junio de 1995-actualidad) [ 18 ]
- Negobot , un bot diseñado para atrapar pedófilos en línea haciéndose pasar por una niña y tratando de obtener detalles personales de las personas con las que habla. [ 19 ]
Organizaciones de procesamiento del lenguaje natural
- AFNLP (Federación Asiática de Asociaciones de Procesamiento del Lenguaje Natural) : la organización que coordina las actividades y eventos relacionados con el procesamiento del lenguaje natural en la región de Asia-Pacífico.
- Asociación de Lingüística Computacional : sociedad científica y profesional internacional para personas que trabajan en problemas relacionados con el procesamiento del lenguaje natural.
Conferencias relacionadas con el procesamiento del lenguaje natural
- Reunión anual de la Asociación de Lingüística Computacional (ACL)
- Conferencia Internacional sobre Procesamiento Inteligente de Textos y Lingüística Computacional (CICLing)
- Conferencia Internacional sobre Recursos Lingüísticos y Evaluación : conferencia bienal organizada por la Asociación Europea de Recursos Lingüísticos con el apoyo de instituciones y organizaciones involucradas en el procesamiento del lenguaje natural.
- Conferencia anual del capítulo norteamericano de la Asociación de Lingüística Computacional (NAACL)
- Texto, habla y diálogo (TSD) – conferencia anual
- Conferencia de Recuperación de Texto (TREC): serie continua de talleres centrados en diversas áreas o líneas de investigación sobre recuperación de información (RI).
Empresas dedicadas al procesamiento del lenguaje natural
- AlchemyAPI : proveedor de servicios de una API de procesamiento del lenguaje natural.
- Google, Inc. – el motor de búsqueda de Google es un ejemplo de resumen automático, que utiliza la extracción de palabras clave.
- Calais (producto de Reuters) : proveedor de servicios de procesamiento del lenguaje natural.
- Wolfram Research, Inc., desarrollador del motor de computación de procesamiento del lenguaje natural Wolfram Alpha .
Publicaciones sobre procesamiento del lenguaje natural
Libros
- Enfoques conexionistas, estadísticos y simbólicos para el aprendizaje en el procesamiento del lenguaje natural – Wermter, S., Riloff E. y Scheler, G. (editores). [ 20 ] Primer libro que abordó el aprendizaje estadístico y de redes neuronales del lenguaje.
- Procesamiento del habla y del lenguaje: una introducción al procesamiento del lenguaje natural, el reconocimiento del habla y la lingüística computacional – por Daniel Jurafsky y James H. Martin . [ 21 ] Libro introductorio sobre tecnología del lenguaje.
Serie de libros
- Estudios sobre procesamiento del lenguaje natural : serie de libros de la Asociación de Lingüística Computacional, publicada por Cambridge University Press.
Revistas
- Lingüística Computacional : revista académica revisada por pares en el campo de la lingüística computacional. Es publicada trimestralmente por MIT Press para la Asociación de Lingüística Computacional (ACL).
Personas influyentes en el procesamiento del lenguaje natural
- Daniel Bobrow –
- Rollo Carpenter – creador de Jabberwacky y Cleverbot.
- Noam Chomsky – autor de la obra fundamental Estructuras sintácticas , que revolucionó la lingüística con la « gramática universal », un sistema de estructuras sintácticas basado en reglas. [ 22 ]
- Kenneth Colby –
- David Ferrucci , investigador principal del equipo que creó Watson , la computadora con IA de IBM que ganó el concurso Jeopardy!
- Lyn Frazier –
- Daniel Jurafsky es profesor de Lingüística e Informática en la Universidad de Stanford. Junto con James H. Martin , escribió el libro de texto Procesamiento del habla y del lenguaje: Introducción al procesamiento del lenguaje natural, el reconocimiento del habla y la lingüística computacional.
- Roger Schank introdujo la teoría de la dependencia conceptual para la comprensión del lenguaje natural. [ 23 ]
- Árbol de Jean E. Fox –
- Alan Turing – creador de la prueba de Turing .
- Joseph Weizenbaum , autor del chatterbot ELIZA .
- Terry Winograd es profesor de informática en la Universidad de Stanford y codirector del Grupo de Interacción Humano-Computadora de Stanford. Es conocido en los campos de la filosofía de la mente y la inteligencia artificial por su trabajo sobre el lenguaje natural utilizando el programa SHRDLU.
- William Aaron Woods –
- Maurice Gross , autor del concepto de gramática local, [ 24 ] tomando los autómatas finitos como modelo de competencia del lenguaje. [ 25 ]
- Stephen Wolfram – CEO y fundador de Wolfram Research , creador del lenguaje de programación (comprensión del lenguaje natural) Wolfram Language y del motor de computación de procesamiento del lenguaje natural Wolfram Alpha . [ 26 ]
- Víctor Yngve –
Véase también
- Revisión asistida por computadora
- minería de datos
- Watson (computadora)
- minería de textos biomédicos
- Procesamiento de términos compuestos
- Revisión asistida por computadora
- Lenguaje natural controlado
- Procesamiento lingüístico profundo
- Ayuda para la lectura en idiomas extranjeros
- Ayuda para la escritura en idiomas extranjeros
- Tecnología del lenguaje
- Asignación latente de Dirichlet (LDA)
- Indexación semántica latente
- Lista de proyectos de procesamiento del lenguaje natural
- Mapa LRE
- Programación en lenguaje natural
- Reificación (lingüística)
- Plegado semántico
- Sistema de diálogo hablado
- Vector de pensamiento
- Búsqueda transderivacional
- Word2vec
Referencias
- ↑ "...la ciencia moderna es tanto un descubrimiento como una invención. Fue un descubrimiento que la naturaleza generalmente actúa con la suficiente regularidad como para ser descrita mediante leyes e incluso mediante las matemáticas; y requirió invención para idear las técnicas, abstracciones, aparatos y organización para exhibir las regularidades y asegurar sus descripciones con carácter de ley." —p. vii, J. L. Heilbron , (2003, editor jefe) The Oxford Companion to the History of Modern Science Nueva York: Oxford University Press ISBN 0-19-511229-6
- "ciencia" . Diccionario en línea Merriam-Webster . Merriam-Webster , Inc. Consultado el 16 de octubre de 2011.
3 a: conocimiento o sistema de conocimiento que abarca verdades generales o el funcionamiento de leyes generales, especialmente tal como se obtiene y se comprueba mediante el método científico. b: dicho conocimiento o sistema de conocimiento relacionado con el mundo físico y sus fenómenos.
- "ciencia" . Diccionario en línea Merriam-Webster . Merriam-Webster , Inc. Consultado el 16 de octubre de 2011.
- ↑ SWEBOK Pierre Bourque; Robert Dupuis, eds. (2004). Guía del Cuerpo de Conocimientos de Ingeniería de Software - Versión 2004. Editores ejecutivos, Alain Abran, James W. Moore; editores, Pierre Bourque, Robert Dupuis. IEEE Computer Society . pág. 1. ISBN 0-7695-2330-7Archivado del original el 23 de marzo de 2009. Consultado el 9 de diciembre de 2012 .
- ↑ ACM (2006). "Grados y carreras en informática" . ACM. Archivado del original el 17 de junio de 2011. Consultado el 23 de noviembre de 2010 .
- ↑ Laplante, Phillip (2007). Lo que todo ingeniero debería saber sobre ingeniería de software . Boca Raton: CRC. ISBN 978-0-8493-7228-5. Consultado el 21 de enero de 2011 .
- ↑ Dispositivo de entrada Computadora Hope
- ↑ McQuail, Denis. (2005). Teoría de la comunicación de masas de McQuail . 5.ª ed. Londres: SAGE Publications.
- ↑ Yucong Duan, Christophe Cruz (2011), [http – //www.ijimt.org/abstract/100-E00187.htm Formalizing Semantic of Natural Language through Conceptualization from Existence] . International Journal of Innovation, Management and Technology(2011) 2 (1), pp. 37–42.
- ↑ "Módulo de herramientas: Gramática universal de Chomsky" . thebrain.mcgill.ca .
- ↑ Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
- ↑ McCorduck 2004 , pág. 286 , Crevier 1993 , págs. 76-79 , Russell y Norvig 2003 , pág. 19
- ↑ McCorduck 2004 , págs. 291–296 , Crevier 1993 , págs. 134−139
- ↑ «МНОГОЦЕЛЕВОЙ ЛИНГВИСТИЧЕСКИЙ ПРОЦЕССОР ЭТАП-3» . Iitp.ru. Consultado el 14 de febrero de 2012 .
- ↑ "Con el objetivo de aprender como nosotros, una máquina se autoenseña" . New York Times . 4 de octubre de 2010. Consultado el 5 de octubre
de 2010. Desde principios de año, un equipo de investigadores de la Universidad Carnegie Mellon, con el apoyo de subvenciones de la Agencia de Proyectos de Investigación Avanzada de Defensa y Google, y utilizando un clúster de supercomputación de investigación proporcionado por Yahoo, ha estado perfeccionando un sistema informático que intenta dominar la semántica aprendiendo de forma más parecida a un ser humano.
- ↑ Resumen del proyecto , Universidad Carnegie Mellon . Consultado el 5 de octubre de 2010.
- ↑ "Concurso del Premio Loebner 2013" . People.exeter.ac.uk. 14 de septiembre de 2013. Consultado el 2 de diciembre de 2013 .
- ↑ Gibes, Al (25 de marzo de 2002). "El círculo de amigos se amplía cada vez más". Las Vegas Review-Journal (Nevada) .
- ↑ "ActiveBuddy presenta software para crear e implementar agentes interactivos para mensajería de texto; el sitio para desarrolladores de ActiveBuddy ya está abierto: www.BuddyScript.com" . Business Wire . 15 de julio de 2002. Consultado el 16 de enero de 2014 .
- ↑ Lenzo, Kevin (verano de 1998). "Infobots y Purl" . The Perl Journal . 3 (2) . Recuperado el 26 de julio de 2010 .
- ^ Laorden, Carlos; Galán-García, Patxi; Santos, Igor; Sanz, Borja; Hidalgo, José María Gómez; Bringas, Pablo G. (23 de agosto de 2012). Negobot: un agente conversacional basado en la teoría de juegos para la detección de comportamientos pedófilos (PDF) . Saltador. ISBN 978-3-642-33018-6Archivado del original (PDF) el 17 de septiembre de 2013.
- ↑ Wermter, Stephan; Ellen Riloff; Gabriele Scheler (1996). Enfoques conexionistas, estadísticos y simbólicos para el aprendizaje en el procesamiento del lenguaje natural . Springer.
- ↑ Jurafsky, Dan; James H. Martin (2008). Procesamiento del habla y del lenguaje. Una introducción al procesamiento del lenguaje natural, la lingüística computacional y el reconocimiento del habla (2.ª ed.). Upper Saddle River (NJ): Prentice Hall. pág. 2.
- ↑ "SEM1A5 - Parte 1 - Una breve historia del PLN" . Consultado el 25 de junio de 2010 .
- ↑ Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
- ^ Ibrahim, Amr Helmy. 2002. "Maurice Gross (1934-2001). À la mémoire de Maurice Gross". Hermes 34.
- ↑ Dougherty, Ray. 2001. Carta en memoria de Maurice Gross .
- ↑ Wolfram, Stephen (16 de noviembre de 2010). "La programación con lenguaje natural realmente va a funcionar: Blog de Wolfram" . Escritos de Stephen Wolfram .
Bibliografía
- Crevier, Daniel (1993). IA: La tumultuosa búsqueda de la inteligencia artificial . Nueva York, NY: BasicBooks. ISBN 0-465-02997-3.
- McCorduck, Pamela (2004), Máquinas que piensan (2.ª ed.), Natick, MA: AK Peters, Ltd., ISBN 978-1-56881-205-2, OCLC 52197627 .
- Russell, Stuart J.; Norvig , Peter (2003), Inteligencia artificial: un enfoque moderno (2.ª ed.), Upper Saddle River, Nueva Jersey: Prentice Hall, ISBN 0-13-790395-2.
Enlaces externos
- Procesamiento del lenguaje natural
- Esquemas de ciencias aplicadas
- Esquemas