El Código de Caracteres Chinos para el Intercambio de Información ( en chino :中文資訊交換碼) o CCCII es un conjunto de caracteres desarrollado por el Grupo de Análisis de Caracteres Chinos en Taiwán . Se publicó por primera vez en 1980 y se amplió significativamente en 1982 y 1987. [ 1 ]
Se utiliza principalmente en sistemas de bibliotecas . [ 2 ] [ 3 ] Es una de las codificaciones más antiguas y sofisticadas para el chino tradicional (anterior al establecimiento de Big5 en 1984 y CNS 11643 en 1986). [ 2 ] Se distingue por su sistema único para codificar versiones simplificadas y otras variantes de su conjunto principal de caracteres hanzi . [ 1 ]
Una variante de una versión anterior de CCCII es utilizada por la Biblioteca del Congreso como parte de MARC-8 , bajo el nombre de Código de Caracteres de Asia Oriental ( EACC , ANSI/NISO Z39.64), [ 4 ] donde forma parte del soporte JACKPHY de MARC 21. Sin embargo, EACC contiene menos caracteres que las versiones más recientes de CCCII. [ 5 ] [ 1 ] El trabajo realizado en Apple, basado en el Tesauro CJK del Research Libraries Group , que se utilizó para mantener EACC, fue uno de los predecesores directos del conjunto Unihan de Unicode . [ 6 ]
Diseño

Rangos de bytes
CCCII está diseñado como un conjunto de 94n , según lo define ISO/IEC 2022. [ 1 ] Cada carácter chino se representa mediante un código de 3 bytes, donde cada byte es de 7 bits, entre 0x21 y 0x7E inclusive. Por lo tanto, el número máximo de caracteres chinos que se pueden representar en CCCII es 94×94×94 = 830584. En la práctica, el número de caracteres que se pueden codificar con CCCII sería menor que este número, porque los caracteres variantes se codifican en planos ISO 2022 relacionados bajo CCCII, por lo que la mayoría de los puntos de código tendrían que reservarse para variantes.
En la práctica, sin embargo, a veces se utilizan bytes fuera de estos rangos. El código 0x212320 es utilizado por algunas implementaciones como un espacio ideográfico . [ 8 ] Una especificación CCCII utilizada por bibliotecas en Hong Kong utiliza códigos que comienzan con 0x2120 para la puntuación y los símbolos. [ 9 ] El primer byte 0x7F es utilizado por algunas variantes para codificar códigos para algunos hanzi de Repertorio y Ordenación Unificados o Extensión A de Ideogramas Unificados CJK que de otro modo no estarían disponibles (por ejemplo, 0x7F3449 para U+3449 o 0x7F796E para U+796E; [ 9 ] observe cómo los bytes de continuación coinciden con el código UCS-2BE ), y esto puede incluir bytes fuera del rango 0x21–0x7E o incluso 0x20–0x7F, por ejemplo, 0x7F551C para U+551C, [ 10 ] 0x7F5AA4 para U+5AA4 [ 10 ] o 0x7F8EDA para U+8EDA. [ 9 ]
Interacción con la norma ISO 2022
CCCII/EACC no está registrado en el Registro Internacional de Conjuntos de Caracteres Codificados para su Uso con Secuencias de Escape [ 11 ] y , como tal, no tiene una designación de escape estándar para su uso con ISO 2022. MARC-8 asigna a EACC el byte F de uso privado 0x31 ( 1) en su implementación de ANSI X3.41 (ISO 2022). [ 12 ]
Capas y caracteres variantes
Los 94 planos ISO 2022 se agrupan en 16 capas de 6 planos cada una (excepto la capa 16, que contiene los cuatro planos 91-94). [ 1 ] La capa 1 contiene caracteres no hanzi y hanzi , con los no hanzi y los hanzi más utilizados ubicados en el plano 1, y los cinco planos restantes constan de hanzi menos comunes. [ 1 ] La capa 2 contiene caracteres chinos simplificados , con sus números de fila y celda iguales a los de sus equivalentes chinos tradicionales en la capa 1. Las capas 3 a 12 contienen formas variantes adicionales , en números de fila y celda homólogos a las dos primeras capas. [ 13 ]
Las últimas cuatro capas se utilizan para otros fines. Específicamente, la capa 13 contiene caracteres adicionales para la compatibilidad con el idioma japonés ( kana y kokuji japonés ), y la capa 14 contiene caracteres adicionales para la compatibilidad con el idioma coreano ( hangul ). [ 13 ] La capa 15 no se utiliza (está reservada), mientras que la capa 16 se utiliza para otros caracteres. [ 1 ]
Este diseño distintivo ha sido criticado por Christian Wittern del Instituto Internacional de Investigación del Budismo Zen de la Universidad de Hanazono , quien afirma que la relación de las variantes de caracteres "es muy compleja y no puede expresarse en una tabla de códigos fija, unidimensional y cableada". [ 3 ] Ken Lunde lo describe como "uno de los estándares de conjuntos de caracteres mejor pensados de Taiwán", describiendo su estructura como "verdaderamente admirable", pero concluyendo que la sustitución de formas de variantes de OpenType puede proporcionar el mismo nivel de funcionalidad. [ 1 ]
CCCII define aproximadamente 53940 puntos de código en su edición de 1987, aunque un borrador más reciente de 1989 lo amplía a 75684 puntos de código (que comprenden 44167 caracteres únicos y 31517 variantes). EACC, la variante utilizada por la Biblioteca del Congreso, incluye solo un conjunto más pequeño de 15686 caracteres. [ 1 ]
Adopción
En 1995, CCCII o EACC se utilizaban principalmente en bibliotecas de Estados Unidos , Hong Kong y Taiwán . Si bien CCCII prometía una cobertura completa de los caracteres chinos, japoneses y coreanos (CJK) , su compatibilidad se limitaba a hardware especializado; la dificultad para determinar cuándo usar el carácter raíz o la variante, agravada por la falta de glifos de referencia firmemente establecidos, limitó aún más su adopción, lo que provocó que Big5 se utilizara con mayor frecuencia para el chino en esos territorios fuera del ámbito bibliotecario (ya que Unicode aún no se había adoptado ampliamente en ese momento). [ 3 ]
A partir de 2009, EACC todavía se usa ampliamente para fines bibliográficos especializados. [ 1 ] También fue un precursor importante de Unicode: [ 1 ] el trabajo en Apple en una base de datos de referencias cruzadas de caracteres CJK basada en el CJK Thesaurus de Research Libraries Group , utilizado para mantener EACC, se incorporó directamente al desarrollo del conjunto Unihan de Unicode . [ 6 ] Los caracteres hanzi de Unicode se referencian a sus códigos CCCII y EACC correspondientes en la base de datos Unihan , en las claves y ; [ 4 ] sin embargo, dado que los criterios de unificación de caracteres de Unicode (basados en los utilizados por el JIS X 0208 japonés y en los desarrollados por la Asociación para un Código Chino Común en China) difieren de los utilizados por CCCII, no todos los caracteres variantes se asignan individualmente. [ 6 ] Las tablas de asignación para hanzi, hangul , kana y puntuación entre EACC y Unicode están disponibles en la Biblioteca del Congreso. [ 14 ]kCCCIIkEACC
Tablas de puntuación, símbolos, kana y jamo
A continuación se muestran tablas de puntuación, símbolos, kana y jamo del hangul , donde se indican los caracteres y sus posibles correspondencias Unicode. Siempre que es posible, se hace referencia a datos de correspondencia publicados.
Las asignaciones Unicode para las sílabas Hangul se omiten a continuación por brevedad, pero están documentadas por la Biblioteca del Congreso. [ 15 ] Los caracteres hanzi CCCII se cuentan por decenas de miles [ 1 ] [ 3 ] y no se muestran a continuación (excepto cuando también se incluyen en el rango no hanzi, como radicales o numerales), pero las asignaciones a Unicode están disponibles en la base de datos Unihan [ 4 ] y en otros lugares. [ 10 ] [ 9 ]
Conjunto de caracteres 0x2120 (plano 1, fila 0: puntuación de Hong Kong)
Aunque CCCII suele ser un conjunto de 94 n , [ 1 ] y por lo tanto no suele usar códigos que comiencen con 0x2120, [ 10 ] la siguiente disposición es utilizada por una variante utilizada por las bibliotecas en Hong Kong: [ 9 ]
Conjunto de caracteres 0x2121 (plano 1, fila 1: reservado para controles)
No se asignan caracteres en el plano 1, fila 1, que está reservado para códigos de control . [ 1 ]
Conjunto de caracteres 0x2122 (plano 1, fila 2: operadores matemáticos)
Esta fila contiene operadores matemáticos. EACC deja esta fila vacía. [ 14 ] La siguiente tabla se referencia con fuentes de Taiwán. [ 2 ] [ 10 ]
La siguiente tabla se basa en datos del CCCII proporcionados por el Hong Kong Innovative Users Group, un grupo de bibliotecas de Hong Kong, y alojados por la Universidad de Hong Kong . [ 17 ] [ 9 ] En esta fila se utiliza un diseño completamente diferente:
Conjunto de caracteres 0x2123 (plano 1, fila 3: caracteres romanos y signos de puntuación)
Esta fila incluye signos de puntuación, números arábigos occidentales y letras romanas. [ 10 ] Compare la fila 3 del código Wansung con la fila 3 de GB 2312 .
Diferentes variantes codifican de diversas maneras el espacio ideográfico (U+3000) en 0x212320 (que reconoce la especificación MARC), [ 8 ] [ 9 ] 0x212321 (que aparece en el estándar ANSI y también es reconocido por MARC), [ 8 ] [ 9 ] o 0x21635F. [ 10 ] EACC incluye solo el guion-menos , los paréntesis y el espacio ideográfico en este conjunto. [ 8 ]
Conjunto de caracteres 0x212A (plano 1, fila 10: caracteres IME internos y marca geta)
En EACC, esta fila incluye varios caracteres mapeados del Área de Uso Privado que se utilizan internamente para representar componentes de caracteres mediante el método de entrada RLIN , [ 18 ] que utiliza la Biblioteca del Congreso para la catalogación no romana. [ 19 ] Estos caracteres componentes solo deben ser utilizados internamente por un IME y, si se encuentran en otro lugar, pueden ser reemplazados con la marca geta (U+3013), [ 18 ] que esta fila también incluye en 0x212A46. Esta fila no está asignada en CCCII, [ 1 ] pero la marca geta también aparece en esa ubicación en algunos mapeos para CCCII. [ 10 ]
Conjunto de caracteres 0x212B (plano 1, fila 11: puntuación)
Esta fila contiene varios signos de puntuación utilizados en chino, [ 1 ] [ 8 ] además de otros símbolos. CCCII incluye un conjunto de 35 signos de puntuación en esta fila. [ 1 ] EACC incluye solo 13 caracteres en esta fila (mostrados en el recuadro a continuación). [ 8 ]
Conjuntos de caracteres 0x212C–0x212E (plano 1, filas 12–14: radicales y ordinales)
Estas filas contienen radicales chinos , [ 1 ] números romanos , [ 10 ] tallos celestiales y ramas terrestres . [ 16 ]
Conjunto de caracteres 0x212F (plano 1, fila 15: números chinos y bopomofo)
Esta fila incluye numerales chinos y caracteres bopomofo . [ 1 ] EACC incluye solo el cero ideográfico (〇). [ 8 ]
Conjunto de caracteres 0x272B (plano 7, fila 11: marca de referencia)
Esta fila contiene la marca de referencia ( kome jirushi ). [ 10 ]
Conjunto de caracteres 0x272E–0x272F (plano 7, filas 14–15: bopomofo alternativo)
Una variante utilizada por las bibliotecas de Hong Kong no incluye caracteres bopomofo en el plano 1, fila 15, sino que los incluye en una disposición diferente en el plano 7. [ 9 ]
Conjunto de caracteres 0x6921 (plano 73, fila 1: puntuación japonesa)
Esta fila está en el plano 73, el primer plano de la capa 13, que contiene caracteres incluidos para la compatibilidad con el idioma japonés . [ 13 ] Contiene signos de puntuación. [ 8 ] Compárese con la fila 1 de JIS X 0208 , cuyo diseño tiende a seguir esta fila para los caracteres que incluye.
Conjunto de caracteres 0x6924 (plano 73, fila 4: hiragana)
Esta fila contiene hiragana . Compárese con la fila 4 de JIS X 0208 .
Conjunto de caracteres 0x6925 (plano 73, fila 5: katakana)
Esta fila contiene katakana . Compárese con la fila 5 de JIS X 0208 , a la que corresponde esta fila, además de la adición de dakuten y handakuten por separado .
Conjunto de caracteres 0x6F24–0x6F25 (plano 79, filas 4–5: jamo)
Estas filas contienen jamo coreano .
Conjunto de caracteres 0x6F76 (plano 79, fila 86: Hangul arcaico)
Esta fila contiene varios caracteres históricos del Hangul que ya no se usan con regularidad. Varios de ellos están asignados al Área de Uso Privado . [ 18 ]
Conjunto de caracteres 0x7B25 (plano 91, fila 5: Katakana suplementario)
Esta fila contiene katakana adicional que se utiliza para escribir fonemas extranjeros. [ 10 ]
Véase también
Notas a pie de página
- ↑ Fuera del rango de bytes de rastro de un conjunto ISO 2022 94 n , pero se ha observado que algunas implementaciones lo utilizan. [ 8 ]
- ↑ Codificación del espacio ideográfico especificado en el estándar ANSI para EACC. [ 8 ] Esto se usa como signo de exclamación en CCCII, [ 10 ] además del signo de exclamación en 0x212B3D. [ 16 ] La variante HKIUG de Hong Kong de CCCII sigue a EACC aquí. [ 9 ]
- ↑ Las asignaciones de Encode::HanExtra usan U+FE52 para este carácter. [ 10 ] Sin embargo, aparece aquí después de ˊ, ˇ y ˋ, [ 16 ] que son las otras tres marcas de tono para bopomofo . La asignación U+02D9 se usa más comúnmente para esta marca de tono en rangos de codificación de bopomofo, por ejemplo Big5 . [ 20 ]
Referencias
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 Lunde, Ken (2009). Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . págs. 122–124 . ISBN 978-0-596-51447-1.
- 1 2 3 Tang, Audrey (10 de noviembre de 2007). "Encode::HanExtra - Conjuntos adicionales de codificaciones chinas" .
CCCII: La codificación china tradicional más antigua (y sofisticada)... utilizada principalmente en sistemas de bibliotecas... El mapa para "CCCII" es proporcionado por el
proyecto
Koha Taiwan.
- 1 2 3 4 Wittern, Christian (1995-05-01). "Códigos de caracteres chinos: una actualización" . Instituto Internacional de Investigación del Budismo Zen / Universidad de Hanazono . Archivado del original el 12 de octubre de 2004.
- ^ Jenkins , John H .; Cocinero, Richard; Lunde, Ken (5 de marzo de 2020). "Base de datos Unicode Han (Unihan)" . Anexo #38 del estándar Unicode.
- ↑ "Copia archivada" . Archivado del original el 15/06/2016 . Consultado el 15/06/2016 .
{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace ) - 1 2 3 "Apéndice E: Historia de la unificación Han" (PDF) . El estándar Unicode versión 15.0 – Especificación principal . Consorcio Unicode . 2022.
- ↑ Diccionario Kangxi , pág. 1296, carácter. 1
- 1 2 3 4 5 6 7 8 9 10 Biblioteca del Congreso (05/12/2007). "Tabla de códigos de signos de puntuación de Asia Oriental" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Grupo de trabajo Unicode del Grupo de Usuarios Innovadores de Hong Kong. "Tabla de códigos HKIUG para caracteres CJK: mapeo a Unicode" . Bibliotecas de la Universidad de Hong Kong .
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 Tang, Audrey ; Koha Taiwán. " Mapa para CCCII" . Encode::HanExtra . CPAN .
- ↑ "2.4: Conjuntos de caracteres gráficos de múltiples bytes". Registro internacional de conjuntos de caracteres codificados para ser utilizados con secuencias de escape (ISO-IR) (PDF) . ITSCJ/ IPSJ . pág. 14.
- ↑ Biblioteca del Congreso (5 de diciembre de 2007). "Técnica 2: Uso de conjuntos de caracteres gráficos alternativos estándar" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- ^ Lunde, Ken ( 18 de diciembre de 1995). "2.5.2: CCCII". CJK.INF Versión 1.9 .
- 1 2 3 4 5 6 7 8 9 10 11 12 Biblioteca del Congreso (05-12-2007). "Tablas de códigos de Asia Oriental" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- ↑ Biblioteca del Congreso (5 de diciembre de 2007). "Tabla de códigos coreanos Hangul" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- 1 2 3 4 5 6 7 8 9 10 Los caracteres mostrados están, en parte, referenciados cruzadamente con una fuente BDF representativa para CCCII, distribuida por Koichi Yasuoka de la Universidad de Kioto.
- ↑ Grupo de Usuarios Innovadores de Hong Kong (07/01/2013). "Introducción al Grupo de Usuarios Innovadores de Hong Kong" . Bibliotecas de la Universidad de Hong Kong .
- 1 2 3 Biblioteca del Congreso (2004-09-02). "Lista resumida de caracteres MARC 21 asignados al área de uso privado (PUA)" . Especificaciones MARC 21 para la estructura de registros, conjuntos de caracteres y medios de intercambio .
- ↑ Morris, Susan (2007). "Finding JACKPHY: Online Cataloging to Include Arabic, Hebrew, Other Scripts" . Library of Congress Information Bulletin . Vol. 66, no. 12.
- ^ van Kesteren, Ana. "5 grandes" . Estándar de codificación . QUÉ WG .
- Parte de la información de esta página se basa en la información del sitio web oficial del CNS .
Enlaces externos
- El sitio web oficial de CNS 11643 (con versiones en inglés disponibles) contiene información sobre el conjunto de caracteres CCCII en la sección "Código de información chino".
- Mapeo completo de EACC a Unicode, de la Biblioteca del Congreso.
- Introducciones relacionadas con la informática en 1980
- Establecimientos en Taiwán en 1980
- Inventos taiwaneses
- Codificación de caracteres
- Codificaciones de lenguas asiáticas
- Informática en idioma chino