Articulo de referencia

Esquema del procesamiento del lenguaje natural

El procesamiento del lenguaje natural es la actividad informática que utiliza ordenadores para analizar, comprender , modificar o generar lenguaje natural . Esto incluye la auto...

El procesamiento del lenguaje natural es la actividad informática que utiliza ordenadores para analizar, comprender , modificar o generar lenguaje natural . Esto incluye la automatización de cualquier forma, actividad o método de comunicación lingüística, como la conversación , la correspondencia, la lectura , la redacción , el dictado , la publicación , la traducción , la lectura de labios , etc. El procesamiento del lenguaje natural también se refiere a la rama de la informática , la inteligencia artificial y la lingüística que se ocupa de capacitar a los ordenadores para comunicarse mediante el lenguaje natural en todas sus formas, incluyendo, entre otras, el habla , la impresión , la escritura y el lenguaje de señas . El siguiente esquema ofrece una visión general y una guía temática sobre el procesamiento del lenguaje natural:

Procesamiento del lenguaje natural

El procesamiento del lenguaje natural se puede describir como todo lo siguiente:

  • Un campo de la ciencia : una empresa sistemática que construye y organiza el conocimiento en forma de explicaciones y predicciones comprobables sobre el universo. [ 1 ]
    • Una ciencia aplicada : campo que aplica el conocimiento humano para construir o diseñar cosas útiles.
      • Un campo de la informática : el enfoque científico y práctico de la computación y sus aplicaciones.
        • Una rama de la inteligencia artificial : la inteligencia de las máquinas y los robots, y la rama de la informática que tiene como objetivo crearla.
        • Un subcampo de la lingüística computacional : un campo interdisciplinario que se ocupa del modelado estadístico o basado en reglas del lenguaje natural desde una perspectiva computacional.
    • Aplicación de la ingeniería : ciencia, habilidad y profesión de adquirir y aplicar conocimientos científicos, económicos, sociales y prácticos, con el fin de diseñar y construir estructuras, máquinas, dispositivos, sistemas, materiales y procesos.
      • Una aplicación de la ingeniería de software : aplicación de un enfoque sistemático, disciplinado y cuantificable al diseño, desarrollo, operación y mantenimiento de software, y el estudio de estos enfoques; es decir, la aplicación de la ingeniería al software. [ 2 ] [ 3 ] [ 4 ]
        • La programación es un subcampo de la programación informática que consiste en diseñar, escribir, probar, depurar y mantener el código fuente de los programas. Este código fuente se escribe en uno o más lenguajes de programación (como Java, C++, C#, Python, etc.). El objetivo de la programación es crear un conjunto de instrucciones que las computadoras utilizan para realizar operaciones específicas o para mostrar los comportamientos deseados.
  • Un tipo de sistema : conjunto de componentes que interactúan o son interdependientes y que forman un todo integrado o un conjunto de elementos (a menudo llamados "componentes") y relaciones que son diferentes de las relaciones del conjunto o sus elementos con otros elementos o conjuntos.
    • Un sistema que incluye software : el software es un conjunto de programas informáticos y datos relacionados que proporcionan las instrucciones para indicarle a una computadora qué hacer y cómo hacerlo. El software se refiere a uno o más programas informáticos y datos almacenados en la memoria de la computadora. En otras palabras, el software es un conjunto de programas, procedimientos, algoritmos y su documentación relacionados con el funcionamiento de un sistema de procesamiento de datos.
  • Un tipo de tecnología : la creación, modificación, uso y conocimiento de herramientas, máquinas, técnicas, oficios, sistemas y métodos de organización, con el fin de resolver un problema, mejorar una solución preexistente, alcanzar un objetivo, gestionar una relación de entrada/salida o realizar una función específica. También puede referirse al conjunto de dichas herramientas, maquinaria, modificaciones, disposiciones y procedimientos. Las tecnologías influyen significativamente en la capacidad de los seres humanos y de otras especies animales para controlar y adaptarse a sus entornos naturales.
    • Una forma de tecnología informática : las computadoras y sus aplicaciones. El PLN utiliza computadoras, escáneres de imágenes, micrófonos y muchos tipos de programas informáticos.
      • La tecnología del lenguaje comprende, por un lado, el procesamiento del lenguaje natural (PLN) y la lingüística computacional (LC), y por otro, la tecnología del habla. También incluye muchos aspectos aplicados de estas disciplinas. A menudo se la denomina tecnología del lenguaje humano (TLH).

Tecnologías prerrequisito

Las siguientes tecnologías hacen posible el procesamiento del lenguaje natural:

Subcampos del procesamiento del lenguaje natural

El procesamiento del lenguaje natural contribuye a los siguientes campos y hace uso de ellos (de las teorías, herramientas y metodologías):

  • El razonamiento automatizado es un área de la informática y la lógica matemática dedicada a comprender diversos aspectos del razonamiento y a desarrollar software que permita a las computadoras razonar de forma completamente automática, o casi completamente automática. Como subcampo de la inteligencia artificial, el razonamiento automatizado también se fundamenta en la informática teórica y la filosofía de la mente.
  • Lingüística : estudio científico del lenguaje humano. El procesamiento del lenguaje natural requiere comprender la estructura y la aplicación del lenguaje, por lo que se basa en gran medida en la lingüística.
    • Lingüística aplicada : campo de estudio interdisciplinario que identifica, investiga y ofrece soluciones a problemas reales relacionados con el lenguaje. Algunos de los campos académicos relacionados con la lingüística aplicada son la educación, la lingüística, la psicología, la informática, la antropología y la sociología. Algunos de los subcampos de la lingüística aplicada relevantes para el procesamiento del lenguaje natural son:
    • Lingüística computacional : campo interdisciplinario que se ocupa del modelado estadístico o basado en reglas del lenguaje natural desde una perspectiva computacional. Los modelos y herramientas de la lingüística computacional se utilizan ampliamente en el campo del procesamiento del lenguaje natural, y viceversa.
      • Semántica computacional
      • Lingüística de corpus : estudio del lenguaje expresado en muestras (corpus) de texto del "mundo real". Corpus es el plural de corpus , y un corpus es una colección de textos (o segmentos de habla) específicamente seleccionados, compuestos de lenguaje natural. Una vez construido (recopilado o compuesto), un corpus se analiza con los métodos de la lingüística computacional para inferir el significado y el contexto de sus componentes (palabras, frases y oraciones), así como las relaciones entre ellos. Opcionalmente, un corpus puede anotarse ("etiquetarse") con datos (manual o automáticamente) para facilitar su comprensión (por ejemplo, etiquetado de partes de la oración ). Estos datos se aplican posteriormente para interpretar la entrada del usuario, por ejemplo, para realizar mejores predicciones (automatizadas) de lo que la gente está diciendo, para lograr búsquedas web más específicas o para el reconocimiento de voz.
    • Metalingüística
    • Lingüística de signos : estudio científico y análisis de las lenguas de signos naturales, sus características, su estructura (fonología, morfología, sintaxis y semántica), su adquisición (como lengua primaria o secundaria), cómo se desarrollan independientemente de otras lenguas, su aplicación en la comunicación, sus relaciones con otras lenguas (incluidas las lenguas orales) y muchos otros aspectos.
  • La interacción persona-ordenador , que se sitúa en la intersección de la informática y las ciencias del comportamiento, abarca el estudio, la planificación y el diseño de la interacción entre las personas (usuarios) y los ordenadores. Prestar atención a la interacción persona-máquina es fundamental, ya que las interfaces hombre-máquina mal diseñadas pueden provocar numerosos problemas inesperados. Un ejemplo clásico es el accidente de Three Mile Island, donde las investigaciones concluyeron que el diseño de la interfaz hombre-máquina fue, al menos en parte, responsable del desastre.
  • Recuperación de información (RI) : campo que se ocupa del almacenamiento, la búsqueda y la recuperación de información. Es un campo independiente dentro de la informática (más cercano a las bases de datos), pero la RI se basa en algunos métodos de PLN (por ejemplo, la lematización). Algunas investigaciones y aplicaciones actuales buscan tender un puente entre la RI y el PLN.
  • Representación del conocimiento (RC) : área de investigación en inteligencia artificial que busca representar el conocimiento mediante símbolos para facilitar la inferencia a partir de sus elementos, creando así nuevos elementos de conocimiento. La investigación en representación del conocimiento implica el análisis de cómo razonar con precisión y eficacia, y cómo utilizar de la mejor manera un conjunto de símbolos para representar un conjunto de hechos dentro de un dominio del conocimiento.
  • Aprendizaje automático : subcampo de la informática que examina el reconocimiento de patrones y la teoría del aprendizaje computacional en inteligencia artificial. Existen tres enfoques principales para el aprendizaje automático. El aprendizaje supervisado se produce cuando un tutor proporciona a la máquina ejemplos de entradas y salidas para que aprenda una regla que las relacione con las salidas. El aprendizaje no supervisado se produce cuando la máquina determina la estructura de las entradas sin recibir ejemplos de entradas o salidas. El aprendizaje por refuerzo se produce cuando una máquina debe realizar una tarea sin retroalimentación de un tutor.

Estructuras utilizadas en el procesamiento del lenguaje natural

  • Anáfora : tipo de expresión cuya referencia depende de otro elemento referencial. Por ejemplo, en la oración "Sally prefería la compañía de sí misma", "sí misma" es una expresión anafórica, ya que es correferencial con "Sally", el sujeto de la oración.
  • Lenguaje libre de contexto
  • Lenguaje natural controlado : un lenguaje natural con una restricción introducida en su gramática y vocabulario para eliminar la ambigüedad y la complejidad.
  • Corpus : conjunto de datos, opcionalmente etiquetados (por ejemplo, mediante el etiquetado de partes de la oración ), que proporciona muestras del mundo real para su análisis y comparación.
    • Corpus textual : conjunto extenso y estructurado de textos, que hoy en día suelen almacenarse y procesarse electrónicamente. Se utilizan para realizar análisis estadísticos y pruebas de hipótesis, comprobar ocurrencias o validar reglas lingüísticas dentro de un tema (o dominio ) específico.
    • Corpus de voz : base de datos de archivos de audio y transcripciones de texto. En tecnología del habla, los corpus de voz se utilizan, entre otras cosas, para crear modelos acústicos (que luego pueden emplearse con un motor de reconocimiento de voz). En lingüística, los corpus de voz se utilizan para investigar la fonética, el análisis de la conversación, la dialectología y otros campos.
  • Gramática -
  • Lenguaje natural
  • n -grama : secuencia de n elementos, donde un elemento es un carácter, sílaba o palabra. La n se reemplaza por un número. Por lo tanto, un 5-grama es un n- grama de 5 letras, sílabas o palabras. "Eat this" es un 2-grama (también conocido como bigrama).
    • Bigrama : n -grama de 2 tokens. Toda secuencia de 2 elementos adyacentes en una cadena de tokens es un bigrama. Los bigramas se utilizan para el reconocimiento de voz, pueden emplearse para resolver criptogramas y la frecuencia de bigramas es un método para la identificación estadística de idiomas.
    • Trigrama : caso especial del n- grama, donde n es 3.
  • Ontología : representación formal de un conjunto de conceptos dentro de un dominio y las relaciones entre esos conceptos.
    • Taxonomía : práctica y ciencia de la clasificación, incluidos los principios que la sustentan y los métodos para clasificar cosas o conceptos.
      • Hiponimia e hiperonimia : la lingüística de los hipónimos e hiperónimos. Un hipónimo comparte una relación de tipo con su hiperónimo. Por ejemplo, paloma, cuervo, águila y gaviota son todos hipónimos de ave (su hiperónimo), que, a su vez, es un hipónimo de animal.
      • Taxonomía para motores de búsqueda : generalmente denominada "taxonomía de entidades". Se trata de una estructura jerárquica cuyos nodos están etiquetados con entidades que se espera que aparezcan en una consulta de búsqueda web. Estas estructuras se utilizan para relacionar las palabras clave de una consulta de búsqueda con las palabras clave de las respuestas relevantes (o fragmentos).
  • Implicación textual : relación direccional entre fragmentos de texto. Esta relación se cumple siempre que la veracidad de un fragmento de texto se deriva de otro. En el marco de la Teoría de la Implicación Textual (TE), los textos implicante y derivado se denominan texto (t) e hipótesis (h), respectivamente. La relación es direccional porque, si bien "t implica h", la relación inversa "h implica t" es mucho menos segura.
  • Trífono : secuencia de tres fonemas. Los trifonos son útiles en los modelos de procesamiento del lenguaje natural, donde se utilizan para establecer los diversos contextos en los que puede aparecer un fonema en una lengua natural determinada.

Procesos de PLN

Aplicaciones

  • La calificación automatizada de ensayos (CAE) consiste en el uso de programas informáticos especializados para asignar calificaciones a ensayos escritos en un contexto educativo. Es un método de evaluación educativa y una aplicación del procesamiento del lenguaje natural. Su objetivo es clasificar un gran conjunto de entidades textuales en un número reducido de categorías discretas, que corresponden a las posibles calificaciones, por ejemplo, del 1 al 6. Por lo tanto, puede considerarse un problema de clasificación estadística.
  • Anotación automática de imágenes : proceso mediante el cual un sistema informático asigna automáticamente metadatos textuales, como subtítulos o palabras clave, a una imagen digital. Estas anotaciones se utilizan en sistemas de recuperación de imágenes para organizar y localizar imágenes de interés en una base de datos.
  • Generación automática de resúmenes : proceso que consiste en reducir un documento de texto mediante un programa informático para crear un resumen que conserve los puntos más importantes del documento original. Se utiliza a menudo para generar resúmenes de textos de un tipo conocido, como artículos de la sección financiera de un periódico.
    • Tipos
    • Métodos y técnicas
      • Resumen basado en extracción
      • Resumen basado en abstracción
      • Resumen basado en la entropía máxima
      • Extracción de oraciones
      • Resumen asistido
        • Resumen de máquina asistido por humanos (HAMS)
        • Resumen humano asistido por máquina (MAHS)
  • Inducción taxonómica automática : construcción automatizada de estructuras arbóreas a partir de un corpus. Esto puede aplicarse a la creación de sistemas de clasificación taxonómica para usuarios finales, como directorios web o esquemas temáticos.
  • Resolución de correferencias : para obtener la interpretación correcta de un texto, o incluso para estimar la importancia relativa de los distintos sujetos mencionados, es necesario vincular los pronombres y otras expresiones referenciales con las personas u objetos adecuados. A partir de una oración o un fragmento de texto más extenso, la resolución de correferencias determina qué palabras ("menciones") se refieren a qué objetos ("entidades") incluidos en el texto.
    • Resolución de anáforas : se refiere a la correspondencia entre los pronombres y los sustantivos o nombres a los que se refieren. Por ejemplo, en una oración como "Entró en la casa de John por la puerta principal", "la puerta principal" es una expresión referencial y la relación de conexión que se debe identificar es el hecho de que la puerta a la que se hace referencia es la puerta principal de la casa de John (y no la de otra estructura a la que también se podría hacer referencia).
  • Sistema de diálogo
  • Programa de ayuda para la lectura en lengua extranjera : programa informático que ayuda a un usuario no nativo a leer correctamente en el idioma que está aprendiendo. Una lectura correcta implica una pronunciación adecuada y la correcta acentuación de las distintas partes de las palabras.
  • Ayuda para la escritura en lengua extranjera : programa informático o cualquier otro instrumento que ayude a un hablante no nativo (también conocido como aprendiz de lengua extranjera) a escribir correctamente en la lengua meta. Las herramientas de ayuda se pueden clasificar en dos categorías: indicaciones en tiempo real y revisiones posteriores a la escritura.
  • Corrección gramatical : el acto de verificar la corrección gramatical de un texto escrito, especialmente si este acto lo realiza un programa informático .
  • Recuperación de información
  • La traducción automática (TA) tiene como objetivo traducir automáticamente texto de un idioma humano a otro. Este es uno de los problemas más difíciles y pertenece a una clase de problemas denominados coloquialmente " completos para la IA ", es decir, que requieren todos los diferentes tipos de conocimiento que poseen los humanos (gramática, semántica, hechos sobre el mundo real, etc.) para resolverse correctamente.
  • Programación en lenguaje natural : interpretación y compilación de instrucciones comunicadas en lenguaje natural para convertirlas en instrucciones informáticas (código máquina).
  • Búsqueda en lenguaje natural
  • Reconocimiento óptico de caracteres (OCR) : dada una imagen que representa texto impreso, determinar el texto correspondiente.
  • Responder preguntas : dada una pregunta en lenguaje humano, determinar su respuesta. Las preguntas típicas tienen una respuesta correcta específica (como "¿Cuál es la capital de Canadá?"), pero a veces también se consideran preguntas abiertas (como "¿Cuál es el sentido de la vida?").
  • Filtrado de spam
  • El análisis de sentimientos extrae información subjetiva, generalmente de un conjunto de documentos, a menudo utilizando reseñas en línea para determinar la "polaridad" respecto a objetos específicos. Es especialmente útil para identificar tendencias de opinión pública en las redes sociales con fines de marketing.
  • Reconocimiento de voz : dado un fragmento de audio de una o varias personas hablando, determinar la representación textual del habla. Esto es lo opuesto a la conversión de texto a voz y es uno de los problemas extremadamente difíciles que coloquialmente se denominan " inteligentes para IA " (véase más arriba). En el habla natural, casi no hay pausas entre palabras sucesivas, por lo que la segmentación del habla es una subtarea necesaria del reconocimiento de voz (véase más abajo). En la mayoría de los idiomas hablados, los sonidos que representan letras sucesivas se fusionan entre sí en un proceso denominado coarticulación , por lo que la conversión de la señal analógica a caracteres discretos puede ser un proceso muy difícil.
  • Síntesis de voz (conversión de texto a voz)
  • Corrección de textos
  • Simplificación de texto : edición automatizada de un documento para incluir menos palabras o utilizar palabras más sencillas, conservando al mismo tiempo su significado e información subyacentes.

Procesos de componentes

  • La comprensión del lenguaje natural convierte fragmentos de texto en representaciones más formales, como estructuras lógicas de primer orden , que son más fáciles de manipular para los programas informáticos . La comprensión del lenguaje natural implica la identificación de la semántica deseada entre las múltiples semánticas posibles que se pueden derivar de una expresión en lenguaje natural, la cual generalmente adopta la forma de notaciones organizadas de conceptos del lenguaje natural. La introducción y creación de metamodelos y ontologías del lenguaje son soluciones eficientes, aunque empíricas. Para la construcción de una base de formalización semántica, se requiere una formalización explícita de la semántica del lenguaje natural, sin confusiones con supuestos implícitos como el supuesto de mundo cerrado (CWA) frente al supuesto de mundo abierto , o Sí/No subjetivo frente a Verdadero/Falso objetivo. [ 7 ]
  • Generación de lenguaje natural : tarea de convertir información de bases de datos informáticas en lenguaje humano legible.

Procesos componentes de la comprensión del lenguaje natural

Procesos componentes de la generación del lenguaje natural

Generación de lenguaje natural : tarea de convertir información de bases de datos informáticas en lenguaje humano legible.

  • Inducción automática de taxonomías (ATI) : construcción automatizada de estructuras de árbol a partir de un corpus. Si bien la ATI se utiliza para construir el núcleo de las ontologías (y al hacerlo se convierte en un proceso componente de la comprensión del lenguaje natural), cuando las ontologías que se construyen son legibles para el usuario final (como un esquema temático) y se utilizan para la construcción de documentación adicional (como usar un esquema como base para elaborar un informe o tratado), esto también se convierte en un proceso componente de la generación del lenguaje natural.
  • Estructuración de documentos

Historia del procesamiento del lenguaje natural

Historia del procesamiento del lenguaje natural

  • Historia de la traducción automática
  • Historia de la calificación automatizada de ensayos
  • Historia de la interfaz de usuario en lenguaje natural
  • Historia de la comprensión del lenguaje natural
  • Historia del reconocimiento óptico de caracteres
  • Historia de la respuesta a preguntas
  • Historia de la síntesis de voz
  • Prueba de Turing : prueba de la capacidad de una máquina para exhibir un comportamiento inteligente, equivalente o indistinguible del de un ser humano. En el ejemplo ilustrativo original, un juez humano conversa en lenguaje natural con otro humano y una máquina diseñada para generar un desempeño indistinguible del humano. Todos los participantes están separados entre sí. Si el juez no puede distinguir con certeza entre la máquina y el humano, se considera que la máquina ha superado la prueba. Alan Turing introdujo la prueba en su artículo de 1950, "Computing Machinery and Intelligence", que comienza con las palabras: "Me propongo considerar la pregunta: '¿Pueden pensar las máquinas?'"
  • Gramática universal : teoría lingüística , generalmente atribuida a Noam Chomsky , que propone que la capacidad de aprender gramática está programada en el cerebro. [ 8 ] La teoría sugiere que la habilidad lingüística se manifiesta sin ser enseñada ( véase pobreza del estímulo ) y que existen propiedades que comparten todas las lenguas humanas naturales . Es cuestión de observación y experimentación determinar con precisión qué habilidades son innatas y qué propiedades comparten todas las lenguas.
  • ALPAC fue un comité de siete científicos liderado por John R. Pierce, establecido en 1964 por el gobierno estadounidense para evaluar el progreso de la lingüística computacional en general y la traducción automática en particular. Su informe, publicado en 1966, se hizo famoso por su escepticismo hacia la investigación realizada hasta entonces en traducción automática y por enfatizar la necesidad de investigación básica en lingüística computacional; esto provocó que el gobierno estadounidense redujera drásticamente su financiación para este campo.
  • Teoría de la dependencia conceptual : un modelo de comprensión del lenguaje natural utilizado en sistemas de inteligencia artificial. Roger Schank, de la Universidad de Stanford, introdujo este modelo en 1969, en los albores de la inteligencia artificial. [ 9 ] Este modelo fue ampliamente utilizado por los estudiantes de Schank en la Universidad de Yale, como Robert Wilensky, Wendy Lehnert y Janet Kolodner.
  • Red de transición aumentada : tipo de estructura de teoría de grafos utilizada en la definición operacional de lenguajes formales, especialmente en el análisis sintáctico de lenguajes naturales relativamente complejos, y con amplia aplicación en inteligencia artificial. Introducida por William A. Woods en 1970.
  • Traducción de idiomas distribuida (proyecto)

Cronología del software de PNL

Conceptos generales de procesamiento del lenguaje natural

Herramientas de procesamiento del lenguaje natural

  • Google Ngram Viewer : grafica el uso de n -gramas a partir de un corpus de más de 5,2 millones de libros.

Cuerpos

Kits de herramientas para el procesamiento del lenguaje natural

Los siguientes conjuntos de herramientas de procesamiento del lenguaje natural son colecciones destacadas de software para este fin. Se trata de conjuntos de bibliotecas , marcos de trabajo y aplicaciones para el procesamiento simbólico, estadístico y del habla.

Reconocedores de entidades nombradas

  • ABNER (A Biomedical Named-Entity Recognizer) es un programa de minería de texto de código abierto que utiliza modelos de secuencias de campos aleatorios condicionales de cadena lineal. Etiqueta automáticamente genes, proteínas y otros nombres de entidades en el texto. Fue desarrollado por Burr Settles de la Universidad de Wisconsin-Madison.
  • Stanford NER (Reconocedor de Entidades Nombradas): Implementación en Java de un reconocedor de entidades nombradas que utiliza modelos de secuencias de campos aleatorios condicionales de cadena lineal. Etiqueta automáticamente personas, organizaciones y ubicaciones en textos en inglés, alemán, chino y español. Desarrollado por Jenny Finkel y otros miembros del Grupo de Procesamiento del Lenguaje Natural de Stanford en la Universidad de Stanford.

Software de traducción

  • Comparación de aplicaciones de traducción automática
  • Aplicaciones de traducción automática
    • Google Translate
    • DeepL
    • Linguee es un servicio web que ofrece un diccionario en línea para varios pares de idiomas. A diferencia de servicios similares, como LEO, Linguee incorpora un motor de búsqueda que proporciona acceso a una gran cantidad de pares de oraciones bilingües traducidas, procedentes de la World Wide Web. Como herramienta de traducción, Linguee se diferencia de los servicios de traducción automática como Babelfish y su funcionamiento se asemeja más al de una memoria de traducción.
    • Lenguaje de Redes Universal de la UNL
    • Yahoo! Babel Fish
    • Reverso

Otro software

  • CTAKES es un sistema de procesamiento del lenguaje natural de código abierto para la extracción de información de texto libre clínico en historias clínicas electrónicas. Procesa notas clínicas, identificando tipos de entidades clínicas con nombre: fármacos, enfermedades/trastornos, signos/síntomas, localizaciones anatómicas y procedimientos. Cada entidad con nombre tiene atributos para el segmento de texto, el código de mapeo de ontología, el contexto (antecedentes familiares, actual, no relacionado con el paciente) y si está negada o no. También conocido como Apache cTAKES.
  • DMAP
  • ETAP-3 : sistema de procesamiento lingüístico propietario centrado en inglés y ruso. [ 12 ] Es un sistema basado en reglas que utiliza la Teoría del Significado-Texto como su fundamento teórico.
  • JAPE ( Java Annotation Patterns Engine) es un componente de la plataforma de código abierto GATE (General Architecture for Text Engineering). JAPE es un transductor de estados finitos que opera sobre anotaciones basadas en expresiones regulares.
  • LOLITA «Interactor, traductor y analizador lingüístico a gran escala basado en objetos». LOLITA fue desarrollado por Roberto Garigliano y sus colegas entre 1986 y 2000. Fue diseñado como una herramienta de propósito general para procesar texto sin restricciones, que podría servir de base para una amplia variedad de aplicaciones. Su núcleo era una red semántica que contenía unos 90 000 conceptos interconectados.
  • Maluuba es un asistente personal inteligente para dispositivos Android que utiliza un enfoque contextual para la búsqueda, teniendo en cuenta la ubicación geográfica, los contactos y el idioma del usuario.
  • METAL MT : sistema de traducción automática desarrollado en la década de 1980 en la Universidad de Texas y en Siemens, que funcionaba con máquinas Lisp.
  • Aprendizaje de lenguajes sin fin (NELL ): sistema de aprendizaje automático semántico desarrollado por un equipo de investigación de la Universidad Carnegie Mellon y financiado por subvenciones de DARPA, Google y la NSF, con partes del sistema ejecutándose en un clúster de supercomputación proporcionado por Yahoo!. [ 13 ] NELL fue programado por sus desarrolladores para poder identificar un conjunto básico de relaciones semánticas fundamentales entre unos cientos de categorías de datos predefinidas, como ciudades, empresas, emociones y equipos deportivos. Desde principios de 2010, el equipo de investigación de Carnegie Mellon ha estado ejecutando NELL las 24 horas del día, analizando cientos de millones de páginas web en busca de conexiones entre la información que ya conoce y la que encuentra a través de su proceso de búsqueda, para crear nuevas conexiones de una manera que pretende imitar la forma en que los humanos aprenden nueva información. [ 14 ]
  • NLTK
  • Traductor-en-línea.com
  • Regulus Grammar Compiler : sistema de software para compilar gramáticas de unificación en gramáticas para sistemas de reconocimiento de voz.
  • Voz S
  • Siri (software)
  • Habla con él
  • TeLQAS
  • Herramientas de clasificación de Weka
  • word2vec : modelos desarrollados por un equipo de investigadores liderado por Thomas Milkov en Google para generar incrustaciones de palabras que pueden reconstruir parte del contexto lingüístico de las palabras utilizando redes neuronales bidimensionales poco profundas derivadas de un espacio vectorial mucho mayor.
  • Sistema de síntesis de voz para festivales
  • Sistema de reconocimiento de voz CMU Sphinx

Chatterbots

Chatterbot : un agente conversacional basado en texto que puede interactuar con usuarios humanos a través de algún medio, como un servicio de mensajería instantánea . Algunos chatterbots están diseñados para propósitos específicos, mientras que otros conversan con usuarios humanos sobre una amplia gama de temas.

Chatbots clásicos

Chatbots generales

Chatbots de mensajería instantánea

Organizaciones de procesamiento del lenguaje natural

  • AFNLP (Federación Asiática de Asociaciones de Procesamiento del Lenguaje Natural) : la organización que coordina las actividades y eventos relacionados con el procesamiento del lenguaje natural en la región de Asia-Pacífico.
  • Asociación de Lingüística Computacional : sociedad científica y profesional internacional para personas que trabajan en problemas relacionados con el procesamiento del lenguaje natural.

Empresas dedicadas al procesamiento del lenguaje natural

Publicaciones sobre procesamiento del lenguaje natural

Libros

  • Enfoques conexionistas, estadísticos y simbólicos para el aprendizaje en el procesamiento del lenguaje natural Wermter, S., Riloff E. y Scheler, G. (editores). [ 20 ] Primer libro que abordó el aprendizaje estadístico y de redes neuronales del lenguaje.
  • Procesamiento del habla y del lenguaje: una introducción al procesamiento del lenguaje natural, el reconocimiento del habla y la lingüística computacional por Daniel Jurafsky y James H. Martin . [ 21 ] Libro introductorio sobre tecnología del lenguaje.

Serie de libros

Revistas

  • Lingüística Computacional : revista académica revisada por pares en el campo de la lingüística computacional. Es publicada trimestralmente por MIT Press para la Asociación de Lingüística Computacional (ACL).

Personas influyentes en el procesamiento del lenguaje natural

Véase también

Referencias

  1. "...la ciencia moderna es tanto un descubrimiento como una invención. Fue un descubrimiento que la naturaleza generalmente actúa con la suficiente regularidad como para ser descrita mediante leyes e incluso mediante las matemáticas; y requirió invención para idear las técnicas, abstracciones, aparatos y organización para exhibir las regularidades y asegurar sus descripciones con carácter de ley." —p. vii, J. L. Heilbron , (2003, editor jefe) The Oxford Companion to the History of Modern Science Nueva York: Oxford University Press ISBN 0-19-511229-6
    • "ciencia" . Diccionario en línea Merriam-Webster . Merriam-Webster , Inc. Consultado el 16 de octubre de 2011. 3 a: conocimiento o sistema de conocimiento que abarca verdades generales o el funcionamiento de leyes generales, especialmente tal como se obtiene y se comprueba mediante el método científico. b: dicho conocimiento o sistema de conocimiento relacionado con el mundo físico y sus fenómenos.
  2. SWEBOK Pierre Bourque; Robert Dupuis, eds. (2004). Guía del Cuerpo de Conocimientos de Ingeniería de Software - Versión 2004. Editores ejecutivos, Alain Abran, James W. Moore; editores, Pierre Bourque, Robert Dupuis. IEEE Computer Society . pág. 1. ISBN  0-7695-2330-7Archivado del original el 23 de marzo de 2009. Consultado el 9 de diciembre de 2012 .
  3. ACM (2006). "Grados y carreras en informática" . ACM. Archivado del original el 17 de junio de 2011. Consultado el 23 de noviembre de 2010 .
  4. Laplante, Phillip (2007). Lo que todo ingeniero debería saber sobre ingeniería de software . Boca Raton: CRC. ISBN 978-0-8493-7228-5. Consultado el 21 de enero de 2011 .
  5. Dispositivo de entrada Computadora Hope
  6. McQuail, Denis. (2005). Teoría de la comunicación de masas de McQuail . 5.ª ed. Londres: SAGE Publications.
  7. Yucong Duan, Christophe Cruz (2011), [http //www.ijimt.org/abstract/100-E00187.htm Formalizing Semantic of Natural Language through Conceptualization from Existence] . International Journal of Innovation, Management and Technology(2011) 2 (1), pp. 37–42.
  8. "Módulo de herramientas: Gramática universal de Chomsky" . thebrain.mcgill.ca .
  9. Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
  10. McCorduck 2004 , pág. 286 , Crevier 1993 , págs. 76-79 , Russell y Norvig 2003 , pág. 19   
  11. McCorduck 2004 , págs. 291–296 , Crevier 1993 , págs. 134−139  
  12. «МНОГОЦЕЛЕВОЙ ЛИНГВИСТИЧЕСКИЙ ПРОЦЕССОР ЭТАП-3» . Iitp.ru. ​Consultado el 14 de febrero de 2012 .
  13. "Con el objetivo de aprender como nosotros, una máquina se autoenseña" . New York Times . 4 de octubre de 2010. Consultado el 5 de octubre de 2010. Desde principios de año, un equipo de investigadores de la Universidad Carnegie Mellon, con el apoyo de subvenciones de la Agencia de Proyectos de Investigación Avanzada de Defensa y Google, y utilizando un clúster de supercomputación de investigación proporcionado por Yahoo, ha estado perfeccionando un sistema informático que intenta dominar la semántica aprendiendo de forma más parecida a un ser humano.
  14. Resumen del proyecto , Universidad Carnegie Mellon . Consultado el 5 de octubre de 2010.
  15. "Concurso del Premio Loebner 2013" . People.exeter.ac.uk. 14 de septiembre de 2013. Consultado el 2 de diciembre de 2013 .
  16. Gibes, Al (25 de marzo de 2002). "El círculo de amigos se amplía cada vez más". Las Vegas Review-Journal (Nevada) .
  17. "ActiveBuddy presenta software para crear e implementar agentes interactivos para mensajería de texto; el sitio para desarrolladores de ActiveBuddy ya está abierto: www.BuddyScript.com" . Business Wire . 15 de julio de 2002. Consultado el 16 de enero de 2014 .
  18. Lenzo, Kevin (verano de 1998). "Infobots y Purl" . The Perl Journal . 3 (2) . Recuperado el 26 de julio de 2010 .
  19. ^ Laorden, Carlos; Galán-García, Patxi; Santos, Igor; Sanz, Borja; Hidalgo, José María Gómez; Bringas, Pablo G. (23 de agosto de 2012). Negobot: un agente conversacional basado en la teoría de juegos para la detección de comportamientos pedófilos (PDF) . Saltador. ISBN 978-3-642-33018-6Archivado del original (PDF) el 17 de septiembre de 2013.
  20. Wermter, Stephan; Ellen Riloff; Gabriele Scheler (1996). Enfoques conexionistas, estadísticos y simbólicos para el aprendizaje en el procesamiento del lenguaje natural . Springer.
  21. Jurafsky, Dan; James H. Martin (2008). Procesamiento del habla y del lenguaje. Una introducción al procesamiento del lenguaje natural, la lingüística computacional y el reconocimiento del habla (2.ª ed.). Upper Saddle River (NJ): Prentice Hall. pág. 2.  
  22. "SEM1A5 - Parte 1 - Una breve historia del PLN" . Consultado el 25 de junio de 2010 .
  23. Roger Schank , 1969, Un analizador de dependencias conceptuales para el lenguaje natural. Actas de la conferencia de 1969 sobre lingüística computacional, Sång-Säby, Suecia, páginas 1-3.
  24. ^ Ibrahim, Amr Helmy. 2002. "Maurice Gross (1934-2001). À la mémoire de Maurice Gross". Hermes 34.
  25. Dougherty, Ray. 2001. Carta en memoria de Maurice Gross .
  26. Wolfram, Stephen (16 de noviembre de 2010). "La programación con lenguaje natural realmente va a funcionar: Blog de Wolfram" . Escritos de Stephen Wolfram .

Bibliografía

  • Crevier, Daniel (1993). IA: La tumultuosa búsqueda de la inteligencia artificial . Nueva York, NY: BasicBooks. ISBN 0-465-02997-3.
  • McCorduck, Pamela (2004), Máquinas que piensan (2.ª  ed.), Natick, MA: AK Peters, Ltd., ISBN 978-1-56881-205-2, OCLC 52197627 .
  • Russell, Stuart J.; Norvig , Peter (2003), Inteligencia artificial: un enfoque moderno (2.ª  ed.), Upper Saddle River, Nueva Jersey: Prentice Hall, ISBN 0-13-790395-2.