El análisis de texto ruidoso es un proceso de extracción de información cuyo objetivo es extraer automáticamente información estructurada o semiestructurada de datos de texto no estructurados y ruidosos . Si bien el análisis de texto es un campo en crecimiento y maduro que tiene un gran valor debido a la enorme cantidad de datos que se producen, el procesamiento de texto ruidoso está ganando importancia porque muchas aplicaciones comunes producen datos de texto ruidosos. Los datos de texto no estructurados y ruidosos se encuentran en entornos informales como chats en línea , mensajes de texto , correos electrónicos , foros de mensajes , grupos de noticias , blogs , wikis y páginas web . Además, el texto producido al procesar el habla espontánea mediante reconocimiento automático de voz y el texto impreso o manuscrito mediante reconocimiento óptico de caracteres contiene ruido de procesamiento. El texto producido en tales circunstancias suele ser muy ruidoso y contiene errores ortográficos, abreviaturas , palabras no estándar, falsos comienzos, repeticiones, falta de puntuación , falta de información sobre mayúsculas y minúsculas , palabras de relleno de pausas como "eh" y "mmm" y otras disfluencias del habla y los mensajes de texto . Este tipo de texto se encuentra con frecuencia en centros de contacto , salas de chat , reconocimiento óptico de caracteres (OCR) de documentos, mensajes de texto (SMS), etc. Los documentos con lenguaje histórico también pueden considerarse ruidosos desde la perspectiva del conocimiento actual del idioma. Dicho texto contiene información histórica, religiosa y médica antigua de gran utilidad. La naturaleza del texto ruidoso que se produce en todos estos contextos justifica ir más allá de las técnicas tradicionales de análisis de texto.
Técnicas para el análisis de textos ruidosos
La falta de puntuación y el uso de palabras no estándar a menudo dificultan el uso de herramientas estándar de procesamiento del lenguaje natural, como el etiquetado gramatical y el análisis sintáctico . Las técnicas para aprender de los datos con ruido y, posteriormente, procesarlos, apenas se están desarrollando.
Posible fuente de texto ruidoso
- En la World Wide Web , se encuentran textos mal redactados en páginas web, chats en línea , blogs , wikis , foros de discusión y grupos de noticias . La mayoría de estos datos no están estructurados y el estilo de escritura difiere mucho del de, por ejemplo, artículos de noticias bien escritos. El análisis de los datos web es importante porque constituyen fuentes para el análisis de la actividad del mercado, la revisión del mercado, la estimación de tendencias , etc. Además, debido a la gran cantidad de datos, es necesario encontrar métodos eficientes para la extracción , clasificación , resumen automático y análisis de esta información.
- Centros de contacto : Este es un término general para mesas de ayuda, líneas de información y centros de servicio al cliente que operan en dominios que van desde la venta y el soporte de computadoras hasta teléfonos móviles y ropa. En promedio, una persona en el mundo desarrollado interactúa al menos una vez por semana con un agente de un centro de contacto. Un agente típico de un centro de contacto maneja más de cien llamadas por día. Operan en varios modos, como voz, chat en línea y correo electrónico . La industria de los centros de contacto produce gigabytes de datos en forma de correos electrónicos , registros de chat, transcripciones de conversaciones de voz, comentarios de clientes, etc. La mayor parte de los datos de los centros de contacto son conversaciones de voz. La transcripción de estas utilizando el reconocimiento automático de voz de última generación da como resultado texto con una tasa de error de palabras del 30-40% . Además, incluso los modos de comunicación escritos, como el chat en línea entre clientes y agentes e incluso las interacciones por correo electrónico, tienden a ser ruidosos. El análisis de los datos de los centros de contacto es esencial para la gestión de relaciones con el cliente, el análisis de satisfacción del cliente, el modelado de llamadas, la elaboración de perfiles de clientes, la elaboración de perfiles de agentes, etc., y requiere técnicas sofisticadas para manejar texto mal escrito.
- Documentos impresos: Muchas bibliotecas, organizaciones gubernamentales y de defensa nacional cuentan con vastos depósitos de documentos en papel . Para recuperar y procesar el contenido de estos documentos, es necesario utilizar el reconocimiento óptico de caracteres (OCR) . Además del texto impreso, estos documentos también pueden contener anotaciones manuscritas. El texto procesado mediante OCR puede presentar un alto nivel de ruido, dependiendo del tamaño de la fuente, la calidad de la impresión, etc. La tasa de error puede variar desde un 2-3% hasta un 50-60% . Las anotaciones manuscritas pueden ser particularmente difíciles de descifrar, y la tasa de error puede ser bastante alta cuando están presentes.
- Mensajería de texto (SMS): El uso del lenguaje en las comunicaciones mediadas por ordenador, como chats, correos electrónicos y mensajes SMS, difiere significativamente de la forma estándar del idioma. La tendencia a enviar mensajes más cortos para escribir con mayor rapidez y la necesidad de claridad semántica dan forma a la estructura de esta forma no estándar conocida como lenguaje de mensajería.
Véase también
Referencias
- "Wong, W., Liu, W. y Bennamoun, M. Puntuación integrada mejorada para la limpieza de textos sucios. En: Taller IJCAI sobre análisis de datos de texto no estructurados ruidosos (AND), 2007; Hyderabad, India." .
- "LV Subramaniam, S. Roy, TA Faruquie, S. Negi, Un estudio sobre los tipos de ruido en los textos y las técnicas para manejar textos ruidosos. En: Tercer Taller sobre Análisis de Datos de Texto No Estructurados con Ruido (AND), 2009".
- Procesamiento del lenguaje natural
- Lingüística computacional
- Géneros de recuperación de información
- Procesamiento estadístico del lenguaje natural