Articulo de referencia

Segmentación de texto

La segmentación de texto es el proceso de dividir un texto escrito en unidades significativas, como palabras, oraciones o temas . El término se aplica tanto a los procesos menta...

La segmentación de texto es el proceso de dividir un texto escrito en unidades significativas, como palabras, oraciones o temas . El término se aplica tanto a los procesos mentales que utilizan los humanos al leer un texto como a los procesos artificiales implementados en computadoras, que son objeto del procesamiento del lenguaje natural . El problema no es trivial, ya que, si bien algunas lenguas escritas tienen marcadores explícitos de límites de palabras, como los espacios entre palabras del inglés escrito y las formas distintivas de las letras iniciales, medias y finales del árabe , dichas señales a veces son ambiguas y no están presentes en todas las lenguas escritas.

Compárese con la segmentación del habla , que es el proceso de dividir el habla en porciones lingüísticamente significativas.

Problemas de segmentación

Segmentación de palabras

La segmentación de palabras es el problema de dividir una cadena de lenguaje escrito en sus palabras componentes.

En inglés y muchos otros idiomas que utilizan alguna forma del alfabeto latino , el espacio es una buena aproximación a un separador de palabras ( delimitador de palabras ), aunque este concepto tiene limitaciones debido a la variabilidad con la que los idiomas consideran enérgicamente las colocaciones y los compuestos . Muchos sustantivos compuestos en inglés se escriben de forma variable (por ejemplo, ice  box = ice-box = icebox ; pig  sty = pig-sty = pigsty ) con una variación correspondiente en si los hablantes los consideran frases nominales o sustantivos simples; existen tendencias en cómo se establecen las normas, como que los compuestos abiertos a menudo tienden a solidificarse con el tiempo por convención generalizada, pero la variación sigue siendo sistémica. En contraste, los sustantivos compuestos en alemán muestran menos variación ortográfica, siendo la solidificación una norma más fuerte.

Sin embargo, el equivalente al carácter de espacio de palabras no se encuentra en todos los sistemas de escritura, y sin él la segmentación de palabras es un problema difícil. Entre los idiomas que no tienen un proceso de segmentación de palabras sencillo se incluyen el chino y el japonés, donde se delimitan oraciones pero no palabras; el tailandés y el laosiano , donde se delimitan frases y oraciones pero no palabras; y el vietnamita , donde se delimitan sílabas pero no palabras.

Sin embargo, en algunos sistemas de escritura, como la escritura Ge'ez utilizada para el amárico y el tigriña, entre otros idiomas, las palabras están delimitadas explícitamente (al menos históricamente) con un carácter que no es un espacio en blanco.

El Consorcio Unicode ha publicado un Anexo Estándar sobre Segmentación de Texto [ 1 ] que explora los problemas de segmentación en textos multiescritura.

La división de palabras es el proceso de analizar texto concatenado (es decir, texto que no contiene espacios ni otros separadores de palabras) para inferir dónde existen las divisiones de palabras.

La división de palabras también puede referirse al proceso de guionización .

Algunos estudiosos han sugerido que el chino moderno debería escribirse con segmentación de palabras, con espacios entre ellas como en el inglés escrito. [ 2 ] Esto se debe a que existen textos ambiguos cuyo significado solo conoce el autor. Por ejemplo, «美国会不同意。» puede significar «美国 会 不同意。» (Estados Unidos no estará de acuerdo.) o «美 国会 不同意。» (El Congreso de los Estados Unidos no está de acuerdo). Para más detalles, véase Escritura china con segmentación de palabras .

Segmentación de intenciones

La segmentación de intenciones es el problema de dividir las palabras escritas en frases clave (grupos de 2 o más palabras).

En inglés y en todos los demás idiomas, la intención o el deseo principal se identifica y se convierte en la piedra angular de la segmentación de la intención. El producto/servicio principal, la idea, la acción o el pensamiento sirven de base para la frase clave.

"[Todas las cosas están hechas de átomos ]. [Pequeñas partículas que se mueven] [en movimiento perpetuo ], [atrayéndose entre ] [cuando están a poca distancia ], [pero repeliéndose ] [al ser comprimidas ] [unas contra otras ]."

Segmentación de oraciones

La segmentación de oraciones consiste en dividir una cadena de texto escrito en sus oraciones componentes . En inglés y otros idiomas, el uso de la puntuación, en particular el punto , es una aproximación razonable. Sin embargo, incluso en inglés, este problema no es trivial debido al uso del punto para abreviaturas, que pueden o no finalizar una oración. Por ejemplo, «Sr. » no constituye una oración independiente en « El Sr. Smith fue a las tiendas de la calle Jones». Al procesar texto plano, las tablas de abreviaturas que contienen puntos pueden ayudar a evitar la asignación incorrecta de los límites de las oraciones.

Al igual que ocurre con la segmentación de palabras, no todos los idiomas escritos contienen caracteres de puntuación que resulten útiles para aproximar los límites de las oraciones.

Segmentación de temas

El análisis temático consta de dos tareas principales: identificación de temas y segmentación de texto. Mientras que la primera consiste en una simple clasificación de un texto específico, la segunda implica que un documento puede contener múltiples temas, y la tarea de la segmentación de texto computarizada puede ser descubrir estos temas automáticamente y segmentar el texto en consecuencia. Los límites de los temas pueden ser evidentes a partir de los títulos de las secciones y los párrafos. En otros casos, es necesario utilizar técnicas similares a las empleadas en la clasificación de documentos .

La segmentación del texto en temas o turnos discursivos puede resultar útil en algunas tareas de procesamiento natural: puede mejorar significativamente la recuperación de información o el reconocimiento de voz (ya sea indexando o reconociendo documentos con mayor precisión o proporcionando como resultado la parte específica del documento que corresponde a la consulta). También es necesaria en sistemas de detección y seguimiento de temas , así como en problemas de resumen de texto .

Se han probado muchos enfoques diferentes: [ 3 ] [ 4 ] por ejemplo HMM , cadenas léxicas , similitud de pasajes mediante coocurrencia de palabras , agrupamiento , modelado de temas , etc.

Se trata de una tarea bastante ambigua: quienes evalúan los sistemas de segmentación de texto suelen tener límites temáticos diferentes. Por lo tanto, la evaluación de segmentos de texto también representa un problema complejo.

Otros problemas de segmentación

Es posible que se requieran procesos para segmentar el texto en segmentos distintos a los mencionados, incluidos morfemas (una tarea que generalmente se denomina análisis morfológico ) o párrafos .

Enfoques de segmentación automática

La segmentación automática es el problema, dentro del procesamiento del lenguaje natural , de implementar un proceso informático para segmentar texto.

Cuando la puntuación y otras pistas similares no están disponibles de forma consistente, la segmentación suele requerir técnicas bastante complejas, como la toma de decisiones estadísticas, el uso de diccionarios extensos y la consideración de restricciones sintácticas y semánticas. Los sistemas eficaces de procesamiento del lenguaje natural y las herramientas de segmentación de texto suelen operar con texto de dominios y fuentes específicos. Por ejemplo, procesar texto en historiales médicos es un problema muy diferente al de procesar artículos de noticias o anuncios inmobiliarios.

El proceso de desarrollo de herramientas de segmentación de texto comienza con la recopilación de un gran corpus de texto en un dominio de aplicación. Existen dos enfoques generales:

  • Análisis manual de texto y redacción de software personalizado
  • Anote el corpus de muestra con información de límites y utilice aprendizaje automático.

Algunos sistemas de segmentación de texto aprovechan cualquier lenguaje de marcado, como HTML, y conocen formatos de documentos como PDF para proporcionar información adicional sobre los límites de las oraciones y los párrafos.

Véase también

Referencias

  1. UAX #29
  2. ^ Zhang, Xiao-heng (1998).也谈汉语书面语的分词问题——分词连写十大好处[ Revisión de la segmentación de palabras escritas en chino: Diez ventajas de la escritura segmentada de palabras ] .中文信息学报中文信息学报[ Revista de Procesamiento de Información China ] (en chino simplificado). 12 (3): 58– 64 . Recuperado el 31 de marzo de 2025 .
  3. Choi, Freddy YY (2000). "Avances en la segmentación lineal de texto independiente del dominio" . Actas de la 1.ª Reunión del Capítulo Norteamericano de la Asociación de Lingüística Computacional (ANLP-NAACL-00) . págs. 26–33 . arXiv : cs/0003083 . Recuperado el 31 de marzo de 2025 . 
  4. Reynar, Jeffrey C. (1998). Segmentación de temas: algoritmos y aplicaciones (PDF) (tesis doctoral). Universidad de Pensilvania . IRCS-98-21 . Recuperado el 31 de marzo de 2025 .