Articulo de referencia

Lingüística computacional china

La lingüística computacional china es un subconjunto de la lingüística computacional ; es el estudio científico y el procesamiento de la información del idioma chino por medio d...

La lingüística computacional china es un subconjunto de la lingüística computacional ; es el estudio científico y el procesamiento de la información del idioma chino por medio de computadoras. El propósito es obtener una mejor comprensión de cómo funciona el idioma y brindar más comodidad a las aplicaciones lingüísticas . El término lingüística computacional china a menudo se utiliza indistintamente con procesamiento de información china , aunque el primero puede sonar más teórico mientras que el segundo es más técnico. [1]

En lugar de presentar la lingüística computacional en un sentido general, este artículo se centrará en las cuestiones específicas que implica la implementación del idioma chino en comparación con otros idiomas. Los contenidos incluyen el procesamiento de información de caracteres chinos , la segmentación de palabras , el reconocimiento de nombres propios , la comprensión y generación de lenguaje natural, la lingüística de corpus y la traducción automática . [1]

Procesamiento de información de caracteres chinos

La tecnología de la información (TI) es la tecnología de procesamiento informático de caracteres chinos . Mientras que el sistema de escritura inglés utiliza unas pocas docenas de caracteres diferentes, el idioma chino necesita un conjunto de caracteres mucho más grande. Hay más de diez mil caracteres en el Diccionario Xinhua . [2] En el conjunto de caracteres multilingües Unicode de 149.813 caracteres, 98.682 (aproximadamente 2/3) son caracteres chinos. [3] Esto significa que el procesamiento informático de caracteres chinos es el más intensivo entre todos los idiomas.

Entrada de caracteres chinos

La introducción de caracteres chinos por computadora es más complicada que en idiomas que tienen sistemas de caracteres más simples. Por ejemplo, el idioma inglés se escribe con 26 letras y un puñado de otros caracteres, y cada carácter se asigna a una tecla del teclado . Teóricamente, los caracteres chinos podrían introducirse de una manera similar, pero este enfoque es poco práctico para la mayoría de las aplicaciones debido a la cantidad de caracteres; requeriría un teclado enorme con miles de teclas, y al usuario le resultaría difícil y lento localizar caracteres individuales en el teclado. [4] Un método alternativo es utilizar la distribución del teclado inglés y codificar cada carácter chino en los caracteres ingleses; este es el método predominante de introducción de caracteres chinos en la actualidad.

La codificación basada en el sonido normalmente se basa en un esquema de caracteres latinos existente para la fonética china, como el esquema Pinyin para el chino mandarín o Putonghua , y el esquema Jyutping para el dialecto cantonés . El código de entrada de un carácter chino es su cadena de letras pinyin seguida de un número opcional que representa el tono. Por ejemplo, el código de entrada Putonghua Pinyin de香港(Hong Kong) es "xianggang" o "xiang1gang3", y el código Jyutping cantonés es "hoenggong" o "hoeng1gong2", todos los cuales se pueden ingresar fácilmente a través de un teclado inglés.

Un carácter chino puede ser introducido alternativamente mediante codificación basada en forma . La mayoría de los caracteres chinos pueden dividirse en una secuencia de componentes, cada uno de los cuales está compuesto a su vez por una secuencia de trazos en orden de escritura. Hay unos cientos de componentes básicos, [5] mucho menos que la cantidad de caracteres. Al representar cada componente con una letra inglesa y ponerlos en orden de escritura del carácter, el creador del método de entrada puede obtener una cadena de letras lista para ser utilizada como un código de entrada en el teclado inglés. Por supuesto, el creador también puede diseñar una regla para seleccionar letras representativas de la cadena si es demasiado larga. Por ejemplo, en el método de entrada Cangjie , el carácter(border) se codifica como "NGMWM" correspondiente a los componentes "弓土一田一", con algunos componentes omitidos. Los métodos populares de codificación basados ​​en forma incluyen Wubi (五笔) en China continental y Cangjie (仓颉) en Taiwán y Hong Kong. [6]

La característica más importante de la entrada inteligente es la aplicación de restricciones contextuales para la selección de caracteres candidatos. Por ejemplo, en Microsoft Pinyin, cuando el usuario escribe el código de entrada "daxuejiaoshou", obtendrá "大学教授 / 大學教授" (profesor universitario), cuando escribe "daxuepiaopiao" la computadora sugerirá "大雪飘飘 / 大雪飄飄" (nieve intensa). Aunque las letras pinyin sin tono 大学 y 大雪 son ambas "daxue", la computadora puede hacer una selección razonable en función de las palabras subsiguientes. [7]

Codificación de caracteres chinos para el intercambio de información

Dentro de la computadora, cada carácter está representado por un código interno. Cuando un carácter se envía entre dos máquinas, se trata de un código de intercambio de información. Hoy en día, los códigos de intercambio de información, como ASCII y Unicode, se utilizan a menudo directamente como códigos internos.

El primer estándar de codificación de caracteres chinos GB es GB2312 , que fue publicado por la República Popular China en 1980. Incluye 6763 caracteres chinos, con 3755 de uso frecuente ordenados por pinyin y el resto por radicales (componentes de indexación). GB2312 fue diseñado para caracteres chinos simplificados . Los caracteres tradicionales que se han simplificado no están cubiertos. El código de un carácter se representa mediante un número hexadecimal de dos bytes, por ejemplo, los códigos GB de香港(Hong Kong) son CFE3 y B8DB respectivamente. GB2312 todavía se usa en algunas computadoras y en la WWW, aunque se han publicado versiones más nuevas con conjuntos de caracteres extendidos, como GB13000.1 y GB18030. [8] La última versión de la codificación GB es GB18030 , que admite caracteres chinos simplificados y tradicionales, y es consistente con el conjunto de caracteres Unicode. [9]

El estándar de codificación Big5 fue diseñado por cinco grandes empresas de TI en Taiwán a principios de la década de 1980 y ha sido el estándar de facto para representar el chino tradicional en las computadoras desde entonces. Big5 se usa popularmente en Taiwán, Hong Kong y Macao. El estándar Big5 original incluía 13.053 caracteres chinos, sin caracteres simplificados de China continental. Cada carácter está codificado con un código hexadecimal de dos bytes, por ejemplo, 香 (ADBB) 港 (B4E4) 龍 (C073). Los caracteres chinos en el conjunto de caracteres Big5 están dispuestos en orden radical. Las versiones extendidas de Big5 incluyen Big-5E y Big5-2003, que incluyen algunos caracteres simplificados y caracteres cantoneses de Hong Kong. [10]

La versión completa del estándar Unicode representa un carácter con un código digital de 4 bytes, lo que proporciona un enorme espacio de codificación para cubrir todos los caracteres de todos los idiomas del mundo. El Plano Multilingüe Básico (BMP) es una versión de núcleo de 2 bytes de Unicode con 2^16=65.536 puntos de código para caracteres importantes de muchos idiomas. Hay 27.522 caracteres en el Área de Ideogramas CJKV (China, Japón, Corea y Vietnam), incluidos todos los caracteres chinos simplificados y tradicionales en GB2312 y Big5 tradicional. En Unicode 15.0, hay un conjunto de caracteres multilingües de 149.813 caracteres, entre los cuales más de 98.682 (aproximadamente 2/3) son chinos ordenados por radicales Kangxi . Incluso están disponibles caracteres muy poco utilizados. Por ejemplo: H (0048) K (004B), 香 (9999), 港 (6E2F), 龍(9F8D), 龙 (9F99), 龖 (9F96), 龘 (9F98), 𪚥 (2A6A5). [11] [12]

El código Unicode se está volviendo cada vez más popular. Se informa que el 98,1 % de todos los sitios web utilizan UTF-8 (Unicode). Se cree que Unicode reemplazará a todos los demás códigos de intercambio de información y códigos internos, y ya no habrá más confusión de códigos. [13]

Salida de caracteres chinos

Al igual que el inglés y otros idiomas, los caracteres chinos se imprimen en impresoras y pantallas en diferentes fuentes y estilos. Las fuentes chinas más populares son las familias Song (宋体), Kai (楷体), Hei (黑体) y Fangsong (仿宋体). [14]

Las fuentes se presentan en distintos tamaños. Además del sistema de medición internacional de puntos , los caracteres chinos también se miden mediante números de tamaño (llamados zihao , 字号), inventados por un estadounidense para la imprenta china en 1859. [15]

Segmentación de palabras

Es fácil reconocer palabras en un texto en inglés porque están separadas por espacios. Sin embargo, las palabras chinas no están separadas por ningún marcador de límite. Por lo tanto, la segmentación de palabras es el primer paso para el análisis de texto en chino. Por ejemplo,

中文信息学报(texto original chino)
中文 信息 学报(texto segmentado por palabras)
Revista de información china (traducción al inglés palabra por palabra)
Revista de procesamiento de información china (nombre en inglés)

La segmentación de palabras chinas en una computadora se lleva a cabo haciendo coincidir caracteres en el texto chino con un léxico (lista de palabras chinas) de manera progresiva desde el comienzo de la oración o de manera regresiva desde el final. Existen dos tipos de ambigüedades de segmentación: la de tipo intersección (交集型歧义字段) y la de tipo polinomial (多义型歧义字段) [16] ).

Normalmente, una ambigüedad de intersección tiene el formato de

ABC, donde A, AB, BC y C son todas palabras del léxico.

Es posible dividir la cadena de caracteres original en la palabra AB seguida de C, o A seguida de BC. Por ejemplo, "美国会" puede significar "美 国会" (el Parlamento de los EE. UU.) o "美国 会" (los EE. UU. pueden/quieren).

La forma más común de ambigüedad en la segmentación polinómica es AB, donde A, B y AB son todas palabras. Esto significa que la cadena de caracteres puede considerarse como una sola palabra o dividirse en dos. Por ejemplo, la cadena '可以' en las siguientes oraciones:

(1) No hay nada mejor que eso.
    Puedes sentarte.
    Puedes sentarte.
(2) 你 可 以 他们 为 样板。
    Puedes tomarlos como ejemplo.
    Puedes tomarlos como ejemplo.

Las ambigüedades en la segmentación de palabras se pueden resolver con información contextual, utilizando reglas lingüísticas y la probabilidad de coubicaciones de palabras derivadas de corpus chinos. Por lo general, la coincidencia de palabras más largas es más confiable. La tasa de corrección de la segmentación automática de palabras ha alcanzado el 95 % [17] . Sin embargo, no habrá garantía de una corrección del 100 % en el futuro previsible, porque eso implicará una comprensión completa del texto. Una solución alternativa es alentar a las personas a escribir de forma segmentada por palabras, como se hace en inglés [18] . Pero eso no significa que la segmentación de palabras por computadora ya no sea necesaria, porque incluso en inglés, la segmentación de palabras es necesaria para el análisis del habla.

Reconocimiento de nombres propios

Un nombre propio es el nombre de una persona, un lugar, una institución, etc. y se escribe en inglés con la letra inicial de cada palabra en mayúscula, por ejemplo, 'Mr. John Nealon', 'America' y 'Cambridge University'. Sin embargo, los nombres propios chinos no suelen estar marcados en ningún estilo. [19]

El reconocimiento de nombres de personas y lugares en textos chinos puede apoyarse en una lista de nombres. Sin embargo, dicha lista nunca puede estar completa, considerando la enorme cantidad de lugares y personas en todo el mundo, por no mencionar su característica dinámica de ir, venir y cambiar. Y hay nombres similares a sustantivos no propios. Por ejemplo, hay una ciudad llamada 民众 (Minzhong) en el sur de China, que también es un sustantivo común que significa 'pueblo'. Por lo tanto, el reconocimiento de nombres de personas y lugares tiene que hacer uso de sus características distintivas en la composición interna y el contexto externo. Los corpus con sustantivos propios anotados también pueden servir como referencia útil. [19]

Un nombre de pueblo que no se encuentra en el diccionario se puede reconocer con una lista de apellidos y títulos, por ejemplo '张大方先生'',李经理', donde 张 (Zhang) y 李 (Li) son apellidos chinos, y 先生 (Sr.) y 经理 (Gerente) son títulos. En 张大方说, 张大方 se puede reconocer con éxito como el nombre de una persona por la regla de que un nombre de pila chino normalmente sigue al apellido y consta de 1 o 2 caracteres, y el hecho de que las personas pueden pronunciar (说).

Los nombres de lugares también tienen características útiles para el reconocimiento informático. Por ejemplo, en '在广东省中山市民众镇', las palabras componentes 省 (provincia), 市 (ciudad) y 镇 (pueblo) son marcadores finales de nombres de lugares, mientras que 在 (en, en, en) es una preposición frecuente. que aparece frente a una ubicación.

La tasa de exactitud del reconocimiento por computadora ha alcanzado alrededor del 90 % para los nombres de personas y el 95 % para los nombres de lugares [17] .


Revistas y actas

  • Revista de procesamiento de información china (http://jcip.cipsc.org.cn/CN/home)
  • Revista internacional de lingüística computacional y procesamiento del idioma chino (IJCLCLP) (https://www.accllp.org.tw/journal/index.php)
  • Conferencia nacional china sobre lingüística computacional china (https://link.springer.com/conference/cncl)
  • Actas de Rocling (https://www.accllp.org.tw/pub_proce.php)

Véase también

Notas

Referencias

Citas

  1. ^Ab Zhang 2016, pág. 420.
  2. ^ Instituto de Idiomas 2020.
  3. ^ "Estadísticas Unicode". www.unicode.org . Consultado el 8 de diciembre de 2023 .
  4. ^ Su 2014, pág. 218.
  5. ^ Comisión Nacional de la Lengua 1997.
  6. ^ Zhang 2016, pág. 422.
  7. ^ Su 2014, pág. 222.
  8. ^ Su 2014, págs. 213–215.
  9. ^ Lunde, Ken (4 de agosto de 2022). "El estándar GB 18030-2022". Medio . Consultado el 7 de agosto de 2022 .
  10. ^ "[Mac chino] Conjuntos de caracteres". chinesemac.org . Consultado el 24 de noviembre de 2023 .
  11. ^ "Estadísticas Unicode".
  12. ^ Consorcio Unicode 2023.
  13. ^ "Estadísticas de uso y cuota de mercado de UTF-8 para sitios web, diciembre de 2023". w3techs.com . Consultado el 8 de diciembre de 2023 .
  14. ^ Li 2013, pág. 62.
  15. ^ Zhang 2006.
  16. ^ Liu 2000, págs. 58–61.
  17. ^ desde Xu 2006.
  18. ^ Zhang 1998.
  19. ^Ab Zhang 2016, pág. 427.

Obras citadas

  • Fromkin, Victora (y Robert Rodman) (1993). Introducción al lenguaje (5.ª ed.). Nueva York: HBJ. ISBN 0-03-075379-1.
  • Instituto de Idiomas, Academia China de Ciencias Sociales (2020). Diccionario Xinhua (en chino) (12.ª ed.). Beijing: Commercial Press. ISBN 978-7-100-17093-2.
  • Li, Dasui Historia del arte (2013). El agua que fluye a través de la corriente eléctrica[ Caracteres chinos concisos y prácticos ] (en chino) (3.ª ed.). Pekín: Peking University Press. ISBN 978-7-301-21958-4.
  • Liu, Kaiying (edición en inglés) (2000). 中文文本自动分词和标注[ Segmentación automática de palabras y anotación de textos chinos ] (en chino). Beijing: Commercial Press). ISBN 7-100-03068-4.
  • Comisión Nacional de la Lengua (1997). Norma de componentes de caracteres chinos del conjunto de caracteres GB13000.1 para el procesamiento de la información (PDF) . Pekín: Comisión Nacional de la Lengua de China.
  • Su, Peicheng苏培成 (2014). El programa de televisión de la BBC "The Last Stand"[ Conceptos básicos de los caracteres chinos modernos ] (en chino) (3ª ed.). Beijing: 商务印书馆 (La Prensa Comercial, Shangwu). ISBN 978-7-100-10440-1.
  • Consorcio Unicode (2023). Estándar Unicode, versión 15.1.0. Mountain View, CA: Consorcio Unicode.
  • Xu, Jialu (y Fu Yonghe) (2006). 中文信息处理现代汉语词汇研究[ Estudios morfológicos en el procesamiento de información chino moderno ] (en chino). Guangzhou: 广东教育出版社 (Prensa educativa de Guangdong).
  • Zhang, Xiaoheng (1998). "也谈汉语书面语的分词问题 - 分词连写十大好处 ('Segmentación de palabras escritas en chino revisada: diez ventajas de la escritura segmentada de palabras')". Revista de procesamiento de información china . 12 (3): 57–63.
  • Zhang, Xiaoheng (2006). "Los sistemas numéricos, de puntos y métricos de tamaño de fuente (字形的"号制""点制"与"米制")". Ingeniería Informática y Aplicaciones (计算机工程与应用) . 42 (2006) (10): 175–177 y pág. 215.
  • Zhang, Xiaoheng (2016). "Lingüística computacional". Enciclopedia Routledge del idioma chino . Oxfordford: Routledge. pp. 420–437. ISBN 978-0-415-53970-8.
Obtenido de "https://es.wikipedia.org/w/index.php?title=Lingüística_computacional_china&oldid=1230363663"