Articulo de referencia

KS X 1001

KS X 1001 , " Código para Intercambio de Información (Hangul y Hanja) ", [ d ] [ 1 ] anteriormente llamado KS C 5601 , es un estándar de conjunto de caracteres codificados de Co...

KS X 1001 , " Código para Intercambio de Información (Hangul y Hanja) ", [ d ] [ 1 ] anteriormente llamado KS C 5601 , es un estándar de conjunto de caracteres codificados de Corea del Sur para representar caracteres Hangul y Hanja en una computadora.

KS X 1001 está codificado con las codificaciones de caracteres heredadas (anteriores a Unicode ) más comunes para el coreano , incluyendo EUC-KR y el Código Unificado de Hangul (UHC) de Microsoft . Contiene sílabas coreanas Hangul, ideogramas CJK (Hanja), caracteres griegos , cirílicos , japoneses ( Hiragana y Katakana ) y otros caracteres.

KS X 1001 se organiza como una tabla de 94×94, siguiendo la estructura de las palabras de código de 2 bytes de ISO 2022 y EUC . Por lo tanto, sus puntos de código son pares de enteros del 1 al 94. Sin embargo, algunas codificaciones (UHC y Johab ), además de proporcionar códigos para cada punto de código, ofrecen códigos adicionales para caracteres que, de otro modo, solo podrían representarse como secuencias de puntos de código.

Historia

Esta norma se conocía anteriormente como KS C 5601. Ha habido varias revisiones de esta norma. Por ejemplo, hubo revisiones en 1987, 1992, 1998 y 2002.

El conjunto de caracteres Wansung ( 완성 ; Wanseong ; lit. ' precomponiendo ' ) [ 1 ] actual, de doble byte, fue estandarizado por la tercera edición de KS C 5601, [ 2 ] que se publicó en 1986. [ 3 ] Es una codificación compatible con ISO 2022 , que se usa típicamente en forma EUC , que asigna códigos de doble byte para sílabas que no son Hangul, Hangul jamo y las sílabas Hangul más comunes, en contraste con Johab ( 조합 ; Johap ; lit. ' combinando ' ) [ 1 ] que no es compatible con ISO 2022, pero asigna códigos de doble byte a todas las sílabas Hangul usando jamo moderno. [ 2 ] Wansung es técnicamente una codificación de longitud variable, que permite que otras sílabas se representen con secuencias de ocho bytes (usando el jamo y el carácter de relleno Hangul), pero esta característica no siempre está implementada. [ 4 ]  

La primera edición de KS C 5601, publicada en 1974, [ 2 ] definió un conjunto de caracteres de longitud variable [ 2 ] de 7 bits que asignaba puntos de código de un solo byte a 51 [ 3 ] jamo básicos de Hangul , de forma algo análoga a JIS C 6220 , en una codificación conocida como "Hangul de N bytes". [ 5 ] La segunda edición, publicada en 1982, conservó el conjunto de caracteres principal de la edición de 1974, pero definió dos conjuntos suplementarios, incluyendo una versión de Johab. Ninguna de las dos ediciones fue adoptada tan ampliamente como se pretendía. [ 2 ]

Wansung se mantuvo sin cambios en las ediciones de 1987 y 1992. En la edición de 1992, se agregó material adicional en el anexo, [ 3 ] incluyendo la definición de la codificación Johab [ 6 ] en el anexo 3, y la codificación Hangul de N bytes más antigua en el anexo 4. [ 1 ] [ 5 ] Se publicó en respuesta al uso industrial de Johab como una codificación que competía con Wansung, siendo utilizada en ese momento por Hangul Word Processor . Tras la introducción del Código Hangul Unificado por Microsoft en Windows 95 , y el abandono de Johab por parte de Hangul Word Processor en favor de Unicode en 2000, Johab dejó de usarse comúnmente. [ 2 ]

Codificaciones

Los esquemas de codificación de KS X 1001 incluyen EUC-KR (tanto en variantes basadas en ASCII como en ISO 646 -KR, esta última incluye un símbolo de moneda won ( ) en el byte 0x 5C en lugar de una barra invertida) e ISO-2022-KR , [ 7 ] así como ISO-2022-JP-2 (que también codifica JIS X 0208 y JIS X 0212 ). Todos estos tienen el inconveniente de que solo asignan códigos para las 2350 sílabas precompuestas de Hangul que tienen sus propios puntos de código KS X 1001 (de un total de 11172, sin contar las que usan jamo obsoleto), y requieren que otros usen secuencias de composición de ocho bytes, que no son compatibles con algunas implementaciones parciales del estándar. [ 4 ]

La codificación Johab (estipulada en el anexo 3 de la versión de 1992 del estándar) y el superconjunto EUC-KR conocido como Código Hangul Unificado (UHC, también llamado Windows-949) proporcionan códigos únicos para las 11172 sílabas Hangul. [ 7 ] [ 6 ] ISO-2022-KR y Johab se utilizan raramente. Algunos sistemas operativos extienden este estándar de otras maneras no uniformes, por ejemplo, las extensiones EUC-KR MacKorean en el Mac OS clásico e IBM-949 de IBM .

Relleno de Hangul

El carácter Hangul Filler se utiliza para introducir secuencias de composición Hangul de ocho bytes [ 8 ] [ 9 ] y para sustituir un elemento ausente (normalmente un final vacío) en dicha secuencia. [ 9 ]

Unicode incluye el código Wansung Hangul Filler en el bloque Hangul Compatibility Jamo para compatibilidad de ida y vuelta, pero utiliza su propio sistema (con sus propios caracteres de relleno, utilizados de manera diferente) para componer Hangul. El sistema de composición Hangul KS X 1001 no se utiliza en Unicode, y el relleno se representa simplemente como un espacio vacío; las secuencias de composición KS X 1001 que utilizan jamo moderno pueden asignarse a caracteres precompuestos en Unicode. [ 9 ] Esto no se suele hacer con el código Hangul unificado .

Para garantizar la compatibilidad bidireccional, Unicode también incluye el código Hangul de N bytes, Hangul Filler, por separado en el bloque de Formas de Ancho Medio y Ancho Completo , denominado "Halfwidth Hangul Filler".

Diagramas de códigos Wansung

A continuación se muestran las tablas de códigos para KS X 1001 en la disposición Wansung. Cuando se proporciona un par de números hexadecimales, se utiliza el menor al codificarse sobre GL (0x21-0x7E), como en ISO-2022-KR cuando se ha cambiado al conjunto coreano, y el mayor se utiliza en el caso más típico de codificarse sobre GR (0xA1-0xFE), como en EUC-KR o UHC. Johab modifica la disposición para codificar los 11172 grupos de caracteres Hangul por separado y en orden.

Para ilustrar las diferencias de implementación entre proveedores, se muestran varias asignaciones Unicode para algunos caracteres. Se muestran las extensiones HangulTalk de Apple al plano Wansung (es decir, donde ambos bytes se encuentran en el rango 0xA1-0xFE), pero no otros rangos de extensión HangulTalk. Tampoco se muestran los códigos adicionales para sílabas compuestas en el Código Hangul Unificado ni las extensiones de IBM en IBM-949 , ya que ambos quedan fuera del plano Wansung.

bytes de plomo

conjuntos no precompuestos que no son Hanja

Las filas 41 y 94 pueden utilizarse para fines definidos por el usuario. [ 10 ]

Conjunto de caracteres 0x21 / 0xA1 (número de fila 1, caracteres especiales)

Este conjunto contiene signos de puntuación y otros símbolos, excluyendo los signos de puntuación presentes en KS X 1003 (que se incluye en la fila 3). Las codificaciones que combinan KS X 1001 con ASCII de un solo byte pueden usar una asignación Unicode alternativa al bloque de formas de ancho medio y ancho completo para la barra invertida. La asignación Unicode del guion ondulado (guion de tilde) también difiere entre proveedores y puede ser U+301C (preferido por IBM y Apple) [ 11 ] [ 12 ] [ 13 ] o U+223C (preferido por Microsoft). [ 14 ] [ 15 ] Compare el manejo similar pero no idéntico del guion ondulado JIS y el manejo de la tilde en la siguiente fila.

Excepto por la barra invertida, si se muestran dos asignaciones a continuación, la primera es utilizada por Apple y la segunda por Microsoft. [ 13 ] [ 15 ]

Conjunto de caracteres 0x22 / 0xA2 (fila número 2, caracteres especiales)

Este conjunto contiene signos de puntuación y símbolos adicionales. De forma similar al carácter de tilde de la fila anterior, Apple y Microsoft utilizan asignaciones diferentes para el carácter de tilde de esta fila (U+02DC por Apple, FF5E por Microsoft), [ 13 ] [ 15 ] que se pretende que se muestre como una tilde en relieve, mientras que la tilde de la fila anterior se pretende que se muestre en línea a la altura de un guion. [ 10 ] La asignación del punto rodeado con un círculo también difiere. [ 13 ] [ 15 ]

El símbolo del euro y el de marca registrada se añadieron al estándar en 1998, mientras que la marca postal coreana (㉾) se añadió en 2002. [ 1 ] Estos tres puntos de código, al igual que los puntos de código aún no utilizados, han sido empleados para otros fines no estándar por los proveedores, por ejemplo, para marcadores de listas en recuadros por Apple. [ 16 ] Microsoft actualizó su implementación del Código Hangul Unificado para añadir las adiciones de 1998, incluido el símbolo del euro, pero no añadió la marca postal coreana cuando se añadió al estándar. [ 17 ]

Conjunto de caracteres 0x23 / 0xA3 (número de fila 3, latín básico / ISO 646-KR)

Este conjunto corresponde a KS X 1003 (la variante ISO 646 para coreano, similar a ASCII ), pero como códigos de dos bytes precedidos por 0x23 (o 0xA3 en la forma invocada por GR (EUC)). Incluye el alfabeto inglés / alfabeto latino básico , los números arábigos occidentales y la puntuación.

Compare el conjunto romano de JIS X 0201 , que se diferencia por incluir un símbolo de yen en lugar de uno de won . Compare las terceras filas de KPS 9566 y de JIS X 0208 , que siguen el diseño ISO 646 pero solo incluyen letras y dígitos.

Las codificaciones como EUC-KR y UHC combinan KS X 1001 con ASCII de un solo byte o KS X 1003, y por lo tanto utilizan asignaciones Unicode alternativas al bloque de formas de ancho medio y ancho completo para las representaciones de doble byte de estos caracteres.

Conjunto de caracteres 0x24 / 0xA4 (número de fila 4, Hangul jamo)

Este conjunto incluye consonantes modernas del Hangul, seguidas de vocales, ambas ordenadas según las costumbres de intercalación surcoreanas, seguidas de consonantes obsoletas. Cuando se usan individualmente, estos caracteres se corresponden con el bloque Jamo de compatibilidad Unicode Hangul y no tienen una correspondencia uno a uno con los caracteres específicos de posición en el bloque Jamo del Hangul . Compárese con la fila 4 del KPS 9566 norcoreano . El carácter 04-52 es un relleno del Hangul (véase más arriba ), utilizado para combinar secuencias.

Conjunto de caracteres 0x25 / 0xA5 (fila número 5, números romanos y griegos)

Este conjunto contiene números romanos y soporte básico para el alfabeto griego , sin diacríticos ni la sigma final . Apple incluye algunos signos de puntuación adicionales en esta fila, así como algunos marcadores de lista en círculo negro que continúan desde los de la fila 6. [ 16 ]

Compárese con la fila 6 de KPS 9566 , que incluye los mismos caracteres pero con una disposición diferente.

Conjunto de caracteres 0x26 / 0xA6 (fila número 6, dibujo de caja)

Esta fila contiene caracteres para dibujar cuadros en un contexto semigráfico . Apple también incluye algunos marcadores de lista en círculos negros. [ 16 ]

Conjunto de caracteres 0x27 / 0xA7 (número de fila 7, símbolos de unidad)

Esta fila contiene símbolos de unidades como caracteres individuales, incluidos aquellos que constan de varias letras. Apple también incluye algunos marcadores de lista rodeados con un círculo que continúan desde los de la fila 8. [ 16 ]

Compare y contraste con el repertorio de símbolos de unidades incluidos en la fila 8 de KPS 9566 .

Conjunto de caracteres 0x28 / 0xA8 (número de fila 8, latín extendido, encerrado en un círculo, fracciones)

Conjunto de caracteres 0x29 / 0xA9 (número de fila 9, latín extendido, encerrado en un círculo, superíndice y subíndice)

Conjunto de caracteres 0x2A / 0xAA (fila número 10, Hiragana)

Este conjunto contiene caracteres Hiragana para escribir el idioma japonés . Apple también incluye algunos marcadores de lista entre corchetes que continúan desde los de la fila 9. [ 16 ]

Compare la fila 10 de KPS 9566 , que utiliza el mismo diseño. Compare y contraste la fila 4 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.

Conjunto de caracteres 0x2B / 0xAB (número de fila 11, Katakana)

Este conjunto contiene katakana para escribir el idioma japonés . Sin embargo, la marca de vocal larga japonesa , que se usa en texto katakana y se incluye en la fila 1 de JIS X 0208 , no está incluida. [ 20 ] Apple también incluye algunos marcadores de lista entre corchetes que continúan desde los de las filas 9 y 10. [ 16 ]

Compare la fila 11 de KPS 9566 , que utiliza el mismo diseño. Compare y contraste la fila 5 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.

Conjunto de caracteres 0x2C / 0xAC (fila número 12, cirílico)

Este conjunto contiene el alfabeto ruso moderno y no necesariamente es suficiente para representar otras formas de la escritura cirílica . Apple también incluye algunos marcadores de lista en recuadros negros. [ 16 ]

Compare la fila 5 de KPS 9566 y la fila 7 de JIS X 0208 , que utilizan la misma disposición (pero en una fila diferente).

Conjunto de caracteres extendido 0x2D / 0xAD (número de fila 13, puntuación adicional de Apple)

Conjuntos precompuestos de caracteres Hangul (filas 16 a 40)

Los puntos de código para el Hangul precompuesto se incluyen en un bloque ordenado continuo entre los puntos de código 16-01 y 40-94 inclusive. No todos los grupos de sílabas posibles se incluyen en este rango. Compare el orden y la disponibilidad diferentes en KPS 9566 .

Las sílabas iniciales + vocales + finales 뢨, 썅, 쏀, 쓩 y 쭁 están incluidas, pero sus contrapartes iniciales + vocales 뢔, 쌰, 쎼, 쓔 y 쬬 no lo están. Esto puede causar un problema con la entrada de datos, ya que los métodos de entrada deben pasar primero por una sílaba inicial + vocal para llegar a una sílaba inicial + vocal + final (por ejemplo, ㅎ → 하 → 한).

Los que no aparecen en esta lista pueden representarse mediante secuencias de composición de ocho bytes. El UHC asigna códigos a todos los demás clústeres modernos de jamo en otros lugares. Johab asigna códigos a todos los posibles clústeres modernos de jamo.

Estadísticas de jamo

Conjuntos de caracteres Hanja (filas número 42 a 93)

KS X 1001 codifica los caracteres hanja con múltiples pronunciaciones varias veces, una vez por cada pronunciación. (Algunas pronunciaciones provienen del chino medio y otras son consecuencia de la regla del sonido inicial ). Un carácter, 樂, se codifica cuatro veces. Los primeros 268 caracteres (U+F900–U+FA0B) del bloque de ideogramas de compatibilidad CJK corresponden a estas duplicaciones.

En la tabla siguiente, el valor (y la lectura) de la primera celda de la fila para cada Hanja se corresponde con el bloque de Ideogramas Unificados CJK ; los demás se corresponden con el bloque de Ideogramas de Compatibilidad CJK.

Codificación Johab

Diagrama de codificación Johab según lo estipulado por KS X 1001
  • Página : Hangul
  • Página : Hanja
  • 특수문자 : caracteres especiales (caracteres que no son Hangul ni Hanja)

Desde 1992, KS X 1001 también define una codificación alternativa conocida como Johab. Esta representa una sílaba Hangul como la secuencia de tres valores de cinco bits, divididos en dos bytes de 8 bits , con el bit más significativo primero. El bit más significativo del byte inicial siempre está activado (lo que permite la combinación con ASCII de un solo byte o KS X 1003 ). Esta codificación también se utiliza para el jamo moderno de la fila 4 de KS X 1001 , utilizando los valores de relleno para los demás componentes. La codificación Johab para Hangul se muestra en la tabla siguiente. [ 22 ]

Johab codifica el resto de KS X 1001 usando bytes iniciales que no corresponden a un jamo inicial (0xE0–0xF9 para Hanja y 0xD9–0xDE [ 23 ] para no Hanja, excluyendo sílabas Hangul y jamo moderno), con bytes finales en los rangos 0x31–0x7E y 0x91–0xFE. [ 22 ] Estos códigos se asignan algorítmicamente a partir de los puntos de código KS X 1001 de los caracteres, [ 23 ] con dos filas KS X 1001 por byte inicial (comparar y contrastar Shift JIS ).

Diseño de la variante Johab basada en EBCDIC cuando está en estado de doble byte

La codificación Johab basada en ASCII está numerada como página de código 1361 por Microsoft. [ 24 ] También existen otras variantes de Johab definidas por el proveedor; por ejemplo, IBM define una para usar como un conjunto Shift Out con EBCDIC . Esa variante usa shift in y shift out para cambiar entre una página EBCDIC de un solo byte y Johab, usa una codificación diferente para los caracteres que no son Hangul (usando bytes iniciales 0x40–6C con una disposición diferente) y usa bytes iniciales 0xD4–DD como una región definida por el usuario , pero usa la misma disposición de Johab que el estándar de 1992 para los caracteres Hangul cuando está en estado shift-out. [ 25 ] IBM numera la codificación Johab con estado basada en EBCDIC como página de código 1364 , [ 25 ] y también define un subconjunto de esa codificación, que incluye menos caracteres Hangul pero en la misma disposición, como página de código 933. [ 26 ]

Algunos otros proveedores, como Samsung o GoldStar (ahora LG ), utilizaron otras codificaciones "Johab" donde las asignaciones de códigos de cinco bits a jamo difieren de las que se muestran a continuación, por lo que no son compatibles con el estándar Johab de 1992. [ af ] La tabla que aparece a continuación corresponde al estándar de 1992 y también al uso de IBM.

Por ejemplo, la sílaba Hangul 한 se codifica en 1 10100 00011 00101binario, que está D065en hexadecimal.

Código Hangul de N bytes

Este es el código Hangul de N bytes, [ 5 ] como lo especifica KS C 5601-1974 y el anexo 4 de KS C 5601–1992. La segunda mitad de la página de código 1040 de IBM [ 27 ] es un superconjunto de este, que asigna los caracteres ¢¬\~(aunque no £) a las mismas ubicaciones que en la página de código 1041 , mientras que el Hangul de N bytes sin extender (aparte de los gráficos de reemplazo del código de control C0 en algunos contextos de uso, compartido con IBM-1040) es la página de código 891. [ 28 ] El carácter 0x40/0xC0 es un relleno Hangul (ver más arriba ), utilizado en secuencias de combinación.

De forma similar a su homólogo japonés JIS C 6220 (JIS X 0201), el código Hangul de N bytes podría utilizarse como una codificación de 7 bits, con asignaciones de caracteres en el rango de 0x 40 a 0x7C. [ 5 ] El siguiente gráfico muestra el código en un entorno de 8 bits con el bit más alto activado (es decir, de 0xC0 a 0xFC), como se utiliza, por ejemplo, en la página de códigos 891 o 1040.

Notas a pie de página

  1. Faltan diacríticos griegos y sigma final .
  2. Faltan chōonpu , shinjitai , kokuji .
  3. 1 2 Falta la minúscula å , aunque se incluye el signo de Angstrom U+212B Å en mayúscula , así como ambos casos de Ø y Æ .
  4. Coreano : 정보 교환용 부호계 (한글 및 한자) ; RR : Jeongbo Gyohwannyong Buhogye (Hangeul mit Hanja)  
  5. 1 2 Como unconjunto de caracteres94 n compatible con ISO 2022 , el espacio simple y el carácter de borrar siempre están disponibles como códigos de un solo byte en 0x20 y 0x7F (no en 0xA0 y 0xFF) respectivamente.
  6. 1 2 3 4 5 6 7 8 9 Mapeado por Apple a una secuencia del dígito ASCII, el cuadrado combinatorio U+20DE y el carácter de uso privado U+F87C. [ 16 ] La apariencia que se muestra aquí es simulada.
  7. 1 2 3 4 5 6 7 8 9 10 11 Mapeado por Apple a una secuencia ASCII con el número entre corchetes , precedido por el carácter de uso privado U+F863. [ 16 ] La apariencia que se muestra aquí es simulada.
  8. Más estrecho que 0xA2D2. Apple añade un carácter de uso privado U+F87F para fines de comunicación bidireccional.
  9. Dos líneas verticales, con la línea derecha más gruesa. Apple asigna esto al carácter doble vertical ordinario U+2016 (‖) más un carácter de uso privado U+F87B para fines de ida y vuelta; aquí se muestra U+1D102 para reflejar la apariencia prevista.
  10. Dos líneas verticales, con la línea de la izquierda más gruesa. Apple asigna esto al carácter doble vertical ordinario U+2016 (‖) más un carácter de uso privado U+F87C para fines de ida y vuelta; aquí se muestra U+1D103 para reflejar la apariencia prevista.
  11. Variante alineada a la esquina inferior izquierda de la celda del carácter, para uso horizontal. Apple la asigna a U+FF01+F874, donde U+F874 es un carácter de uso privado utilizado por Apple para etiquetar el carácter con fines de ida y vuelta. [ 16 ] Más recientemente, [ 18 ] se ha añadido una secuencia de variación estandarizada para esta forma, utilizando un Selector de Variación 1 (U+FE00) adjunto. [ 19 ]
  12. Variante alineada a la esquina inferior izquierda de la celda del carácter, para uso horizontal. Apple la asigna a U+3002+F87D, donde U+F87D es un carácter de uso privado utilizado por Apple para etiquetar el carácter con fines de ida y vuelta. [ 16 ] Más recientemente, [ 18 ] se ha añadido una secuencia de variación estandarizada para esta forma, utilizando un Selector de Variación 1 (U+FE00) adjunto. [ 19 ]
  13. 1 2 Duplicado, mapeado por Apple con un carácter de uso privado añadido U+F87F para el viaje de ida y vuelta. [ 16 ]
  14. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3257+F87A, donde U+F87A es un carácter de uso privado y U+3257 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  15. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3258+F87A, donde U+F87A es un carácter de uso privado y U+3258 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  16. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3259+F87A, donde U+F87A es un carácter de uso privado y U+3259 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  17. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+325A+F87A, donde U+F87A es un carácter de uso privado y U+325A es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  18. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3251+F87A, donde U+F87A es un carácter de uso privado y U+3251 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  19. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3252+F87A, donde U+F87A es un carácter de uso privado y U+3252 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  20. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3253+F87A, donde U+F87A es un carácter de uso privado y U+3253 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  21. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3254+F87A, donde U+F87A es un carácter de uso privado y U+3254 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  22. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3255+F87A, donde U+F87A es un carácter de uso privado y U+3255 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  23. No existe una coincidencia exacta en Unicode, como se muestra en la simulación. Apple la asigna a U+3256+F87A, donde U+F87A es un carácter de uso privado y U+3256 es el carácter sin rellenar que está rodeado por un círculo. [ 16 ]
  24. 1 2 3 4 5 6 7 8 9 10 Mapeado por Apple a una secuencia ASCII, precedida por el carácter de uso privado U+F862. [ 16 ]
  25. 1 2 3 4 5 6 7 8 9 Mapeado por Apple a una secuencia del dígito ASCII, el cuadrado combinatorio U+20DE y el carácter de uso privado U+F875. [ 16 ] La apariencia que se muestra aquí es simulada.
  26. 1 2 3 4 5 6 7 8 9 10 11 Mapeado por Apple a una secuencia ASCII con el número entre corchetes , precedido por el carácter de uso privado U+F866. [ 16 ] La apariencia que se muestra aquí es simulada.
  27. 1 2 3 4 Estos caracteres son en gran medida duplicados en la fila 1. Apple los describe como versiones "largas" y agrega el carácter de uso privado U+F879 para fines de viaje de ida y vuelta. [ 16 ]
  28. 1 2 3 4 La codificación MacKorean también incluye varios conjuntos de flechas de estilo diferente (incluidas flechas blancas) fuera de los rangos del plano KS X 1001, con bytes iniciales 0xA8 y 0xAC, y bytes finales entre 0x41 y 0xA0. Apple agrega el carácter de uso privado U+F878 a este conjunto particular de flechas blancas para fines de viaje de ida y vuelta. [ 16 ]
  29. 1 2 A diferencia de las de la fila 1 , estas dos marcas están destinadas a mostrarse en una posición baja (de forma similar a U+301F). Apple añade el carácter de uso privado U+F873 para distinguirlas. [ 16 ]
  30. Apple asigna esto a U+21E7+F87F, donde U+21E7 es la flecha blanca hacia arriba [ 16 ] y U+F87F es un carácter de uso privado , aunque este carácter es una flecha negra. [ 21 ] El carácter mostrado es un carácter Unicode posterior a la tabla de asignación de Apple y se asemeja al glifo [ 21 ] para este carácter MacKorean.
  31. Apple asigna esto a una secuencia del signo de exclamación ASCII seguido del carácter de uso privado U+F87F. [ 16 ]
  32. Algunos mapeos para estas codificaciones están disponibles aquí .
  33. 1 2 3 4 Si se utilizara este, daría como resultado un byte de rastro en el rango de códigos de control C0 .
  34. 1 2 3 4 Si se utilizara este, resultaría en bytes de cola en las filas 0x2_ y 0x3_ de ASCII. Johab no utiliza la fila 0x2_ para bytes de cola, de forma similar a la mayoría de las codificaciones CJK heredadas comunes (compárese con Shift JIS , GBK , Big5 ). La versión de Johab basada en EBCDIC no utiliza bytes de cola de ninguna de las dos filas, debido a que se encuentran dentro del rango del código de control EBCDIC.

Referencias

  1. 1 2 3 4 5 Lunde, Ken (2009). "Capítulo 3: Estándares de conjuntos de caracteres" . Procesamiento de información CJKV . O'Reilly Media, Inc. págs. 143–148 . ISBN  978-0596514471.
  2. 1 2 3 4 5 6 Hwang, Jinsang (2005). La configuración social de los estándares de las TIC: un caso de controversia sobre los estándares nacionales de conjuntos de caracteres codificados en Corea (PDF) . Universidad de Edimburgo.
  3. ^ Lunde, Ken ( 18 de diciembre de 1995). "2.4.6: Normas obsoletas". CJK.INF Versión 1.9 .
  4. 1 2 Shin, Jungshik. "¿Qué son KS X 1001 (KS C 5601) y otros códigos Hangul?" . Preguntas frecuentes sobre Hangul e Internet en Corea .
  5. ^ Lunde, Ken ( 18 de diciembre de 1995). "3.3.6: Hangul de N bytes". CJK.INF Versión 1.9 .
  6. 1 2 "INFO: Conjuntos de caracteres Hangul (coreano)" , Soporte de Microsoft , Microsoft
  7. 1 2 Zsigri, Gyula (2002-06-18). "KSC y UHC" .
  8. Chang, Hye-Shik (28 de noviembre de 2021). "cpython/Modules/cjkcodecs/_codecs_kr.c (revisión d3faf43)" . Árbol de código fuente de cPython . Python Software Foundation.
  9. 1 2 3 Chung, Jaemin (2017-03-30). Propuesta para agregar una nota informativa a U+3164 HANGUL FILLER (PDF) . Consorcio Unicode . UTC L2/17-081.
  10. 1 2 Oficina de Normas de Corea (1988-10-01). Conjunto de caracteres gráficos coreanos para el intercambio de información (PDF) . ITSCJ/ IPSJ . ISO-IR -149.
  11. "ibm-1363_P110-1997 (byte principal A1)" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode / Consorcio Unicode .
  12. "euc-kr (byte inicial A1)" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode.
  13. 1 2 3 4 "Mapa (versión externa) de la codificación coreana de Mac OS a Unicode 3.2 y posterior" . Apple.
  14. "windows-949-2000 (byte inicial A1)" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode / Consorcio Unicode .
  15. 1 2 3 4 "Byte inicial A1-A2 (página de código 949)" . MSDN . Microsoft. 6 de febrero de 2008.
  16. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 Apple (2005-04-05). "Mapa (versión externa) de la codificación coreana de Mac OS a Unicode 3.2 y posterior" . Consorcio Unicode .
  17. "windows-949-2000 (byte inicial A2)" . Demostración de ICU - Explorador de convertidores . Componentes internacionales para Unicode / Consorcio Unicode .
  18. 1 2 Lunde, Ken (2018-01-21). "Propuesta para agregar secuencias de variación estandarizadas para la puntuación de Asia Oriental de ancho completo" (PDF) . UTC L2 /17-436.
  19. 1 2 "StandardizedVariants.txt: Secuencias de variación estandarizadas" . Base de datos de caracteres Unicode . Consorcio Unicode .
  20. Lunde, Ken (2009). «Caracteres aparentemente faltantes». Procesamiento de información CJKV: Informática china, japonesa, coreana y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . pág. 180. ISBN   978-0-596-51447-1.
  21. 1 2 Lunde, Ken (2009). "Apéndice E: Estándares de conjuntos de caracteres del proveedor" (PDF) . Procesamiento de información CJKV: Informática en chino, japonés, coreano y vietnamita (2.ª ed.). Sebastopol, CA : O'Reilly . ISBN  978-0-596-51447-1.
  22. 1 2 3 Lunde, Ken (2008). «Capítulo 4: Métodos de codificación (§ Codificación Johab—KS X 1001:2004)». Procesamiento de la información CJKV (2.ª ed.). Sebastopol, California : O'Reilly Media . págs. 268–273 . ISBN   978-0-596-51447-1.
  23. 1 2 Shin, Jungshik (2011-10-14) [1999-08-16]. Tabla de Johab a Unicode . Consorcio Unicode .
  24. "Identificadores de página de códigos" . Centro de desarrollo de Windows . Microsoft. 7 de enero de 2021.
  25. 1 2 "ibm-1364_P110-2007" . Componentes internacionales para Unicode . Consorcio Unicode .
  26. "ibm-933_P110-1995" . Componentes internacionales para Unicode . Consorcio Unicode .
  27. "Página de códigos 01040" (PDF) . IBM. Archivado (PDF) del original el 8 de julio de 2015.
  28. "Página de códigos 00891" (PDF) . IBM. Archivado (PDF) del original el 8 de julio de 2015.
  29. ^ "KSRI-87-37-IR: 한글·한자 코드 표준화에 관한 연구: Un estudio sobre la estandarización de los códigos Hangul y Hanja" (PDF) (en coreano). Ministerio de Ciencia y Tecnología . 1987. pág. 68. Archivado desde el original (PDF) el 1 de marzo de 2019. 
  • ¿Qué son KS X 1001 (KS C 5601) y otros códigos Hangul?
  • Implementación de la conversión de códigos CJKV entre diferentes regiones regionales por Ken Lunde
  • Tablas de correspondencia Unicode para las codificaciones Wansung y Johab:
    • Página de códigos IBM 970 (Wansung, formato EUC-KR)
    • Página 949 del código de Windows (Código Hangul Unificado / Wansung Extendido)
    • Página de códigos de Windows 1361 (Johab, versión basada en ASCII)
    • Página de códigos 1364 de IBM (Johab, versión basada en EBCDIC)