Articulo de referencia

Código de caracteres chinos para el intercambio de información

El Código de Caracteres Chinos para el Intercambio de Información ( en chino : 中文資訊交換碼 ) o CCCII es un conjunto de caracteres desarrollado por el Grupo de Análisis de Caracteres...

El Código de Caracteres Chinos para el Intercambio de Información ( en chino :中文資訊交換碼) o CCCII es un conjunto de caracteres desarrollado por el Grupo de Análisis de Caracteres Chinos en Taiwán . Se publicó por primera vez en 1980 y se amplió significativamente en 1982 y 1987. [ 1 ]

Se utiliza principalmente en sistemas de bibliotecas . [ 2 ] [ 3 ] Es una de las codificaciones más antiguas y sofisticadas para el chino tradicional (anterior al establecimiento de Big5 en 1984 y CNS 11643 en 1986). [ 2 ] Se distingue por su sistema único para codificar versiones simplificadas y otras variantes de su conjunto principal de caracteres hanzi . [ 1 ]

Una variante de una versión anterior de CCCII es utilizada por la Biblioteca del Congreso como parte de MARC-8 , bajo el nombre de Código de Caracteres de Asia Oriental ( EACC , ANSI/NISO Z39.64), [ 4 ] donde forma parte del soporte JACKPHY ​​de MARC 21. Sin embargo, EACC contiene menos caracteres que las versiones más recientes de CCCII. [ 5 ] [ 1 ] El trabajo realizado en Apple, basado en el Tesauro CJK del Research Libraries Group , que se utilizó para mantener EACC, fue uno de los predecesores directos del conjunto Unihan de Unicode . [ 6 ]

Diseño

Nueve caracteres de las implementaciones CCCII o EACC, que se codifican como variantes de( espada de doble filo ). El noveno de estos, 釖, suele ser una variante de. [ 7 ]

Rangos de bytes

CCCII está diseñado como un conjunto de 94n , según lo define ISO/IEC 2022. [ 1 ] Cada carácter chino se representa mediante un código de 3 bytes, donde cada byte es de 7 bits, entre 0x21 y 0x7E inclusive. Por lo tanto, el número máximo de caracteres chinos que se pueden representar en CCCII es 94×94×94 = 830584. En la práctica, el número de caracteres que se pueden codificar con CCCII sería menor que este número, porque los caracteres variantes se codifican en planos ISO 2022 relacionados bajo CCCII, por lo que la mayoría de los puntos de código tendrían que reservarse para variantes.

En la práctica, sin embargo, a veces se utilizan bytes fuera de estos rangos. El código 0x212320 es utilizado por algunas implementaciones como un espacio ideográfico . [ 8 ] Una especificación CCCII utilizada por bibliotecas en Hong Kong utiliza códigos que comienzan con 0x2120 para la puntuación y los símbolos. [ 9 ] El primer byte 0x7F es utilizado por algunas variantes para codificar códigos para algunos hanzi de Repertorio y Ordenación Unificados o Extensión A de Ideogramas Unificados CJK que de otro modo no estarían disponibles (por ejemplo, 0x7F3449 para U+3449 o 0x7F796E para U+796E; [ 9 ] observe cómo los bytes de continuación coinciden con el código UCS-2BE ), y esto puede incluir bytes fuera del rango 0x21–0x7E o incluso 0x20–0x7F, por ejemplo, 0x7F551C para U+551C, [ 10 ] 0x7F5AA4 para U+5AA4 [ 10 ] o 0x7F8EDA para U+8EDA. [ 9 ]

Interacción con la norma ISO 2022

CCCII/EACC no está registrado en el Registro Internacional de Conjuntos de Caracteres Codificados para su Uso con Secuencias de Escape [ 11 ] y , como tal, no tiene una designación de escape estándar para su uso con ISO 2022. MARC-8 asigna a EACC el byte F de uso privado 0x31 ( 1) en su implementación de ANSI X3.41 (ISO 2022). [ 12 ]

Capas y caracteres variantes

The 94 ISO 2022 planes are grouped into 16 layers of 6 planes each (except for layer 16, which contains the four planes 91–94).[1] Layer 1 contains both non-hanzi and hanzi characters, with the non-hanzi and most frequently used hanzi being placed in plane 1, and with the remaining five planes consisting of less common hanzi.[1] Layer 2 contains simplified Chinese characters, with their row and cell numbers being the same as their traditional Chinese equivalents in layer 1. Layers 3 through 12 contain further variant forms, at row and cell numbers homologous to the first two layers.[13]

The last four layers are used for other purposes. Specifically, layer 13 contains additional characters for Japanese language support (kana and Japanese kokuji), and layer 14 contains additional characters for Korean language support (hangul).[13] Layer 15 is unused (reserved), while layer 16 is used for other characters.[1]

This distinctive design has been criticized by Christian Wittern of the International Research Institute for Zen Buddhism at Hanazono University, who asserts that the relationship of character variants "is very complex and can not be expressed in a fixed, one-dimensional, hard-wired codetable".[3]Ken Lunde describes it as "one of the most well thought-out character set standards from Taiwan", describing its structure as "to be truly admired", but concluding that OpenType variant form substitution can provide the same level of functionality.[1]

CCCII defines roughly 53940 code points as of its 1987 edition, although a more recent draft from 1989 extends this to 75684 code points (comprising 44167 unique characters and 31517 variants). EACC, the variant used by the Library of Congress, includes only a smaller set of 15686 characters.[1]

Adoption

En 1995, CCCII o EACC se utilizaban principalmente en bibliotecas de Estados Unidos , Hong Kong y Taiwán . Si bien CCCII prometía una cobertura completa de los caracteres chinos, japoneses y coreanos (CJK) , su compatibilidad se limitaba a hardware especializado; la dificultad para determinar cuándo usar el carácter raíz o la variante, agravada por la falta de glifos de referencia firmemente establecidos, limitó aún más su adopción, lo que provocó que Big5 se utilizara con mayor frecuencia para el chino en esos territorios fuera del ámbito bibliotecario (ya que Unicode aún no se había adoptado ampliamente en ese momento). [ 3 ]

A partir de 2009, EACC todavía se usa ampliamente para fines bibliográficos especializados. [ 1 ] También fue un precursor importante de Unicode: [ 1 ] el trabajo en Apple en una base de datos de referencias cruzadas de caracteres CJK basada en el CJK Thesaurus de Research Libraries Group , utilizado para mantener EACC, se incorporó directamente al desarrollo del conjunto Unihan de Unicode . [ 6 ] Los caracteres hanzi de Unicode se referencian a sus códigos CCCII y EACC correspondientes en la base de datos Unihan , en las claves y ; [ 4 ] sin embargo, dado que los criterios de unificación de caracteres de Unicode (basados ​​en los utilizados por el JIS X 0208 japonés y en los desarrollados por la Asociación para un Código Chino Común en China) difieren de los utilizados por CCCII, no todos los caracteres variantes se asignan individualmente. [ 6 ] Las tablas de asignación para hanzi, hangul , kana y puntuación entre EACC y Unicode están disponibles en la Biblioteca del Congreso. [ 14 ]kCCCIIkEACC

Tablas de puntuación, símbolos, kana y jamo

A continuación se muestran tablas de puntuación, símbolos, kana y jamo del hangul , donde se indican los caracteres y sus posibles correspondencias Unicode. Siempre que es posible, se hace referencia a datos de correspondencia publicados.

Las asignaciones Unicode para las sílabas Hangul se omiten a continuación por brevedad, pero están documentadas por la Biblioteca del Congreso. [ 15 ] Los caracteres hanzi CCCII se cuentan por decenas de miles [ 1 ] [ 3 ] y no se muestran a continuación (excepto cuando también se incluyen en el rango no hanzi, como radicales o numerales), pero las asignaciones a Unicode están disponibles en la base de datos Unihan [ 4 ] y en otros lugares. [ 10 ] [ 9 ]

Conjunto de caracteres 0x2120 (plano 1, fila 0: puntuación de Hong Kong)

Aunque CCCII suele ser un conjunto de 94 n , [ 1 ] y por lo tanto no suele usar códigos que comiencen con 0x2120, [ 10 ] la siguiente disposición es utilizada por una variante utilizada por las bibliotecas en Hong Kong: [ 9 ]

Conjunto de caracteres 0x2121 (plano 1, fila 1: reservado para controles)

No se asignan caracteres en el plano 1, fila 1, que está reservado para códigos de control . [ 1 ]

Conjunto de caracteres 0x2122 (plano 1, fila 2: operadores matemáticos)

Esta fila contiene operadores matemáticos. EACC deja esta fila vacía. [ 14 ] La siguiente tabla se referencia con fuentes de Taiwán. [ 2 ] [ 10 ]

La siguiente tabla se basa en datos del CCCII proporcionados por el Hong Kong Innovative Users Group, un grupo de bibliotecas de Hong Kong, y alojados por la Universidad de Hong Kong . [ 17 ] [ 9 ] En esta fila se utiliza un diseño completamente diferente:

Conjunto de caracteres 0x2123 (plano 1, fila 3: caracteres romanos y signos de puntuación)

Esta fila incluye signos de puntuación, números arábigos occidentales y letras romanas. [ 10 ] Compare la fila 3 del código Wansung con la fila 3 de GB 2312 .

Different variants variously encode the ideographic space (U+3000) at 0x212320 (which the MARC specification acknowledges),[8][9] 0x212321 (which is listed in the ANSI standard, and is also acknowledged by MARC),[8][9] or 0x21635F.[10] EACC includes only the hyphen-minus, parentheses and ideographic space in this set.[8]

  Included in EACC.

Character set 0x212A (plane 1, row 10: internal IME characters and geta mark)

In EACC, this row includes several Private Use Area mapped characters used internally to represent character components by the RLIN input method,[18] which is used by the Library of Congress for non-Roman cataloging.[19] These component characters should only be used internally by an IME and, if encountered elsewhere, may be replaced with the geta mark (U+3013),[18] which this row also includes at 0x212A46. This row is unassigned in CCCII,[1] but the geta mark is also listed at that location in some mappings for CCCII.[10]

Character set 0x212B (plane 1, row 11: punctuation)

This row contains various punctuation marks used in Chinese,[1][8] in addition to other symbols. CCCII includes a set of 35 punctuation marks in this row.[1] EACC includes only 13 characters in this row (shown boxed below).[8]

  Incluido en EACC.

Conjuntos de caracteres 0x212C–0x212E (plano 1, filas 12–14: radicales y ordinales)

Estas filas contienen radicales chinos , [ 1 ] números romanos , [ 10 ] tallos celestiales y ramas terrestres . [ 16 ]

Conjunto de caracteres 0x212F (plano 1, fila 15: números chinos y bopomofo)

Esta fila incluye numerales chinos y caracteres bopomofo . [ 1 ] EACC incluye solo el cero ideográfico (〇). [ 8 ]

  Incluido en EACC.

Conjunto de caracteres 0x272B (plano 7, fila 11: marca de referencia)

Esta fila contiene la marca de referencia ( kome jirushi ). [ 10 ]

Conjunto de caracteres 0x272E–0x272F (plano 7, filas 14–15: bopomofo alternativo)

Una variante utilizada por las bibliotecas de Hong Kong no incluye caracteres bopomofo en el plano 1, fila 15, sino que los incluye en una disposición diferente en el plano 7. [ 9 ]

Conjunto de caracteres 0x6921 (plano 73, fila 1: puntuación japonesa)

Esta fila está en el plano 73, el primer plano de la capa 13, que contiene caracteres incluidos para la compatibilidad con el idioma japonés . [ 13 ] Contiene signos de puntuación. [ 8 ] Compárese con la fila 1 de JIS X 0208 , cuyo diseño tiende a seguir esta fila para los caracteres que incluye.

Conjunto de caracteres 0x6924 (plano 73, fila 4: hiragana)

Esta fila contiene hiragana . Compárese con la fila 4 de JIS X 0208 .

Conjunto de caracteres 0x6925 (plano 73, fila 5: katakana)

Esta fila contiene katakana . Compárese con la fila 5 de JIS X 0208 , a la que corresponde esta fila, además de la adición de dakuten y handakuten por separado .

Conjunto de caracteres 0x6F24–0x6F25 (plano 79, filas 4–5: jamo)

Estas filas contienen jamo coreano .

Conjunto de caracteres 0x6F76 (plano 79, fila 86: Hangul arcaico)

Esta fila contiene varios caracteres históricos del Hangul que ya no se usan con regularidad. Varios de ellos están asignados al Área de Uso Privado . [ 18 ]

Conjunto de caracteres 0x7B25 (plano 91, fila 5: Katakana suplementario)

Esta fila contiene katakana adicional que se utiliza para escribir fonemas extranjeros. [ 10 ]

Véase también

Notas a pie de página

  1. Fuera del rango de bytes de rastro de un conjunto ISO 2022 94 n , pero se ha observado que algunas implementaciones lo utilizan. [ 8 ]
  2. Codificación del espacio ideográfico especificado en el estándar ANSI para EACC. [ 8 ] Esto se usa como signo de exclamación en CCCII, [ 10 ] además del signo de exclamación en 0x212B3D. [ 16 ] La variante HKIUG de Hong Kong de CCCII sigue a EACC aquí. [ 9 ]
  3. Las asignaciones de Encode::HanExtra usan U+FE52 para este carácter. [ 10 ] Sin embargo, aparece aquí después de ˊ, ˇ y ˋ, [ 16 ] que son las otras tres marcas de tono para bopomofo . La asignación U+02D9 se usa más comúnmente para esta marca de tono en rangos de codificación de bopomofo, por ejemplo Big5 . [ 20 ]

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 Lunde, Ken (2009). Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 122–124 . ISBN   978-0-596-51447-1.
  2. 1 2 3 Tang, Audrey (10 de noviembre de 2007). "Encode::HanExtra - Conjuntos adicionales de codificaciones chinas" . CCCII: La codificación china tradicional más antigua (y sofisticada)... utilizada principalmente en sistemas de bibliotecas... El mapa para "CCCII" es proporcionado por el proyecto Koha Taiwan.
  3. 1 2 3 4 Wittern, Christian (1995-05-01). "Códigos de caracteres chinos: una actualización" . Instituto Internacional de Investigación del Budismo Zen / Universidad de Hanazono . Archivado del original el 12 de octubre de 2004.
  4. ^ Jenkins , John H .; Cocinero, Richard; Lunde, Ken (5 de marzo de 2020). "Base de datos Unicode Han (Unihan)" . Anexo #38 del estándar Unicode.
  5. "Copia archivada" . Archivado del original el 15/06/2016 . Consultado el 15/06/2016 .{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace )
  6. 1 2 3 "Apéndice E: Historia de la unificación Han" (PDF) . El estándar Unicode versión 15.0 – Especificación principal . Consorcio Unicode . 2022.
  7. Diccionario Kangxi , pág. 1296, carácter. 1
  8. 1 2 3 4 5 6 7 8 9 10 Biblioteca del Congreso (05/12/2007). "Tabla de códigos de signos de puntuación de Asia Oriental" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
  9. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Grupo de trabajo Unicode del Grupo de Usuarios Innovadores de Hong Kong. "Tabla de códigos HKIUG para caracteres CJK: mapeo a Unicode" . Bibliotecas de la Universidad de Hong Kong .
  10. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 Tang, Audrey ; Koha Taiwán. " Mapa para CCCII" . Encode::HanExtra . CPAN .
  11. "2.4: Conjuntos de caracteres gráficos de múltiples bytes". Registro internacional de conjuntos de caracteres codificados para ser utilizados con secuencias de escape (ISO-IR) (PDF) . ITSCJ/ IPSJ . pág. 14. 
  12. Biblioteca del Congreso (5 de diciembre de 2007). "Técnica 2: Uso de conjuntos de caracteres gráficos alternativos estándar" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
  13. ^ Lunde, Ken ( 18 de diciembre de 1995). "2.5.2: CCCII". CJK.INF Versión 1.9 .
  14. 1 2 3 4 5 6 7 8 9 10 11 12 Biblioteca del Congreso (05-12-2007). "Tablas de códigos de Asia Oriental" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
  15. Biblioteca del Congreso (5 de diciembre de 2007). "Tabla de códigos coreanos Hangul" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
  16. 1 2 3 4 5 6 7 8 9 10 Los caracteres mostrados están, en parte, referenciados cruzadamente con una fuente BDF representativa para CCCII, distribuida por Koichi Yasuoka de la Universidad de Kioto.
  17. Grupo de Usuarios Innovadores de Hong Kong (07/01/2013). "Introducción al Grupo de Usuarios Innovadores de Hong Kong" . Bibliotecas de la Universidad de Hong Kong .
  18. 1 2 3 Biblioteca del Congreso (2004-09-02). "Lista resumida de caracteres MARC 21 asignados al área de uso privado (PUA)" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
  19. Morris, Susan (2007). "Finding JACKPHY: Online Cataloging to Include Arabic, Hebrew, Other Scripts" . Library of Congress Information Bulletin . Vol. 66, n.º 12.  
  20. ^ van Kesteren, Ana. "5 grandes" . Estándar de codificación . QUÉ WG .
  • Parte de la información de esta página se basa en la información del sitio web oficial del CNS .
  • El sitio web oficial de CNS 11643 (con versiones en inglés disponibles) contiene información sobre el conjunto de caracteres CCCII en la sección "Código de información chino".
  • Mapeo completo de EACC a Unicode, de la Biblioteca del Congreso.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Chinese_Character_Code_for_Information_Interchange&oldid=1335560076 "