KS X 1001 , " Código para Intercambio de Información (Hangul y Hanja) ", [ d ] [ 1 ] anteriormente llamado KS C 5601 , es un estándar de conjunto de caracteres codificados de Corea del Sur para representar caracteres Hangul y Hanja en una computadora.
KS X 1001 está codificado con las codificaciones de caracteres heredadas (anteriores a Unicode ) más comunes para el coreano , incluyendo EUC-KR y el Código Unificado de Hangul (UHC) de Microsoft . Contiene sílabas coreanas Hangul, ideogramas CJK (Hanja), caracteres griegos , cirílicos , japoneses ( Hiragana y Katakana ) y otros caracteres.
KS X 1001 se organiza como una tabla de 94×94, siguiendo la estructura de las palabras de código de 2 bytes de ISO 2022 y EUC . Por lo tanto, sus puntos de código son pares de enteros del 1 al 94. Sin embargo, algunas codificaciones (UHC y Johab ), además de proporcionar códigos para cada punto de código, ofrecen códigos adicionales para caracteres que, de otro modo, solo podrían representarse como secuencias de puntos de código.
Historia
Esta norma se conocía anteriormente como KS C 5601. Ha tenido varias revisiones. Por ejemplo, hubo revisiones en 1987, 1992, 1998 y 2002.
El conjunto de caracteres Wansung ( 완성 ; Wanseong ; lit. ' precomponiendo ' ) [ 1 ] actual, de doble byte, fue estandarizado por la tercera edición de KS C 5601, [ 2 ] que se publicó en 1986. [ 3 ] Es una codificación compatible con ISO 2022 , que se usa típicamente en forma EUC , que asigna códigos de doble byte para sílabas que no son Hangul, Hangul jamo y las sílabas Hangul más comunes, en contraste con Johab ( 조합 ; Johap ; lit. ' combinando ' ) [ 1 ] que no es compatible con ISO 2022, pero asigna códigos de doble byte a todas las sílabas Hangul usando jamo moderno. [ 2 ] Wansung es técnicamente una codificación de longitud variable, que permite que otras sílabas se representen con secuencias de ocho bytes (usando el jamo y el carácter de relleno Hangul), pero esta característica no siempre está implementada. [ 4 ]
La primera edición de KS C 5601, publicada en 1974, [ 2 ] definió un conjunto de caracteres de longitud variable [ 2 ] de 7 bits que asignaba puntos de código de un solo byte a 51 [ 3 ] jamo básicos de Hangul , de forma algo análoga a JIS C 6220 , en una codificación conocida como "Hangul de N bytes". [ 5 ] La segunda edición, publicada en 1982, conservó el conjunto de caracteres principal de la edición de 1974, pero definió dos conjuntos suplementarios, incluyendo una versión de Johab. Ninguna de las dos ediciones fue adoptada tan ampliamente como se pretendía. [ 2 ]
Wansung se mantuvo sin cambios en las ediciones de 1987 y 1992. En la edición de 1992, se agregó material adicional en el anexo, [ 3 ] incluyendo la definición de la codificación Johab [ 6 ] en el anexo 3, y la codificación Hangul de N bytes más antigua en el anexo 4. [ 1 ] [ 5 ] Se publicó en respuesta al uso industrial de Johab como una codificación que competía con Wansung, siendo utilizada en ese momento por Hangul Word Processor . Tras la introducción del Código Hangul Unificado por Microsoft en Windows 95 , y el abandono de Johab por parte de Hangul Word Processor en favor de Unicode en 2000, Johab dejó de usarse comúnmente. [ 2 ]
Codificaciones
Los esquemas de codificación de KS X 1001 incluyen EUC-KR (tanto en variantes basadas en ASCII como en ISO 646 -KR, esta última incluye un símbolo de moneda won ( ₩ ) en el byte 0x 5C en lugar de una barra invertida) e ISO-2022-KR , [ 7 ] así como ISO-2022-JP-2 (que también codifica JIS X 0208 y JIS X 0212 ). Todos estos tienen el inconveniente de que solo asignan códigos para las 2350 sílabas precompuestas de Hangul que tienen sus propios puntos de código KS X 1001 (de un total de 11172, sin contar las que usan jamo obsoleto), y requieren que otros usen secuencias de composición de ocho bytes, que no son compatibles con algunas implementaciones parciales del estándar. [ 4 ]
La codificación Johab (estipulada en el anexo 3 de la versión de 1992 del estándar) y el superconjunto EUC-KR conocido como Código Hangul Unificado (UHC, también llamado Windows-949) proporcionan códigos únicos para las 11172 sílabas Hangul. [ 7 ] [ 6 ] ISO-2022-KR y Johab se utilizan raramente. Algunos sistemas operativos extienden este estándar de otras maneras no uniformes, por ejemplo, las extensiones EUC-KR MacKorean en el Mac OS clásico e IBM-949 de IBM .
Relleno de Hangul
El carácter Hangul Filler se utiliza para introducir secuencias de composición Hangul de ocho bytes [ 8 ] [ 9 ] y para sustituir un elemento ausente (normalmente un final vacío) en dicha secuencia. [ 9 ]
Unicode incluye el código Wansung Hangul Filler en el bloque Hangul Compatibility Jamo para compatibilidad de ida y vuelta, pero utiliza su propio sistema (con sus propios caracteres de relleno, utilizados de manera diferente) para componer Hangul. El sistema de composición Hangul KS X 1001 no se utiliza en Unicode, y el relleno se representa simplemente como un espacio vacío; las secuencias de composición KS X 1001 que utilizan jamo moderno pueden asignarse a caracteres precompuestos en Unicode. [ 9 ] Esto no se suele hacer con el código Hangul unificado .
Para garantizar la compatibilidad bidireccional, Unicode también incluye el código Hangul de N bytes, Hangul Filler, por separado en el bloque de Formas de Ancho Medio y Ancho Completo , denominado "Halfwidth Hangul Filler".
Diagramas de códigos Wansung
A continuación se muestran las tablas de códigos para KS X 1001 en la disposición Wansung. Cuando se proporciona un par de números hexadecimales, se utiliza el menor al codificarse sobre GL (0x21-0x7E), como en ISO-2022-KR cuando se ha cambiado al conjunto coreano, y el mayor se utiliza en el caso más típico de codificarse sobre GR (0xA1-0xFE), como en EUC-KR o UHC. Johab modifica la disposición para codificar los 11172 grupos de caracteres Hangul por separado y en orden.
Para ilustrar las diferencias de implementación entre proveedores, se muestran varias asignaciones Unicode para algunos caracteres. Se muestran las extensiones HangulTalk de Apple al plano Wansung (es decir, donde ambos bytes se encuentran en el rango 0xA1-0xFE), pero no otros rangos de extensión HangulTalk. Tampoco se muestran los códigos adicionales para sílabas compuestas en el Código Hangul Unificado ni las extensiones de IBM en IBM-949 , ya que ambos quedan fuera del plano Wansung.
bytes de plomo
conjuntos no precompuestos que no son Hanja
Las filas 41 y 94 pueden utilizarse para fines definidos por el usuario. [ 10 ]
Conjunto de caracteres 0x21 / 0xA1 (número de fila 1, caracteres especiales)
Este conjunto contiene signos de puntuación y otros símbolos, excluyendo los signos de puntuación presentes en KS X 1003 (que se incluye en la fila 3). Las codificaciones que combinan KS X 1001 con ASCII de un solo byte pueden usar una asignación Unicode alternativa al bloque de formas de ancho medio y ancho completo para la barra invertida. La asignación Unicode del guion ondulado (guion de tilde) también difiere entre proveedores y puede ser U+301C (preferido por IBM y Apple) [ 11 ] [ 12 ] [ 13 ] o U+223C (preferido por Microsoft). [ 14 ] [ 15 ] Compare el manejo similar pero no idéntico del guion ondulado JIS y el manejo de la tilde en la siguiente fila.
Excepto por la barra invertida, si se muestran dos asignaciones a continuación, la primera es utilizada por Apple y la segunda por Microsoft. [ 13 ] [ 15 ]
Conjunto de caracteres 0x22 / 0xA2 (fila número 2, caracteres especiales)
Este conjunto contiene signos de puntuación y símbolos adicionales. De forma similar al carácter de tilde de la fila anterior, Apple y Microsoft utilizan asignaciones diferentes para el carácter de tilde de esta fila (U+02DC por Apple, FF5E por Microsoft), [ 13 ] [ 15 ] que se pretende que se muestre como una tilde en relieve, mientras que la tilde de la fila anterior se pretende que se muestre en línea a la altura de un guion. [ 10 ] La asignación del punto rodeado con un círculo también difiere. [ 13 ] [ 15 ]
El símbolo del euro y el de marca registrada se añadieron al estándar en 1998, mientras que la marca postal coreana (㉾) se añadió en 2002. [ 1 ] Estos tres puntos de código, al igual que los puntos de código aún no utilizados, han sido empleados para otros fines no estándar por los proveedores, por ejemplo, para marcadores de listas en recuadros por Apple. [ 16 ] Microsoft actualizó su implementación del Código Hangul Unificado para añadir las adiciones de 1998, incluido el símbolo del euro, pero no añadió la marca postal coreana cuando se añadió al estándar. [ 17 ]
Conjunto de caracteres 0x23 / 0xA3 (número de fila 3, latín básico / ISO 646-KR)
Este conjunto corresponde a KS X 1003 (la variante ISO 646 para coreano, similar a ASCII ), pero como códigos de dos bytes precedidos por 0x23 (o 0xA3 en la forma invocada por GR (EUC)). Incluye el alfabeto inglés / alfabeto latino básico , los números arábigos occidentales y la puntuación.
Compare el conjunto romano de JIS X 0201 , que se diferencia por incluir un símbolo de yen en lugar de uno de won . Compare las terceras filas de KPS 9566 y de JIS X 0208 , que siguen el diseño ISO 646 pero solo incluyen letras y dígitos.
Las codificaciones como EUC-KR y UHC combinan KS X 1001 con ASCII de un solo byte o KS X 1003, y por lo tanto utilizan asignaciones Unicode alternativas al bloque de formas de ancho medio y ancho completo para las representaciones de doble byte de estos caracteres.
Conjunto de caracteres 0x24 / 0xA4 (número de fila 4, Hangul jamo)
Este conjunto incluye consonantes modernas del Hangul, seguidas de vocales, ambas ordenadas según las costumbres de intercalación surcoreanas, seguidas de consonantes obsoletas. Cuando se usan individualmente, estos caracteres se corresponden con el bloque Jamo de compatibilidad Unicode Hangul y no tienen una correspondencia uno a uno con los caracteres específicos de posición en el bloque Jamo del Hangul . Compárese con la fila 4 del KPS 9566 norcoreano . El carácter 04-52 es un relleno del Hangul (véase más arriba ), utilizado para combinar secuencias.
Conjunto de caracteres 0x25 / 0xA5 (fila número 5, números romanos y griegos)
Este conjunto contiene números romanos y soporte básico para el alfabeto griego , sin diacríticos ni la sigma final . Apple incluye algunos signos de puntuación adicionales en esta fila, así como algunos marcadores de lista en círculo negro que continúan desde los de la fila 6. [ 16 ]
Compárese con la fila 6 de KPS 9566 , que incluye los mismos caracteres pero con una disposición diferente.
Conjunto de caracteres 0x26 / 0xA6 (fila número 6, dibujo de caja)
Esta fila contiene caracteres para dibujar cuadros en un contexto semigráfico . Apple también incluye algunos marcadores de lista en círculos negros. [ 16 ]
Conjunto de caracteres 0x27 / 0xA7 (número de fila 7, símbolos de unidad)
Esta fila contiene símbolos de unidades como caracteres individuales, incluidos aquellos que constan de varias letras. Apple también incluye algunos marcadores de lista rodeados con un círculo que continúan desde los de la fila 8. [ 16 ]
Compare y contraste con el repertorio de símbolos de unidades incluidos en la fila 8 de KPS 9566 .
Conjunto de caracteres 0x28 / 0xA8 (número de fila 8, latín extendido, encerrado en un círculo, fracciones)
Conjunto de caracteres 0x29 / 0xA9 (número de fila 9, latín extendido, encerrado en un círculo, superíndice y subíndice)
Conjunto de caracteres 0x2A / 0xAA (fila número 10, Hiragana)
Este conjunto contiene caracteres Hiragana para escribir el idioma japonés . Apple también incluye algunos marcadores de lista entre corchetes que continúan desde los de la fila 9. [ 16 ]
Compare la fila 10 de KPS 9566 , que utiliza el mismo diseño. Compare y contraste la fila 4 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.
Conjunto de caracteres 0x2B / 0xAB (número de fila 11, Katakana)
Este conjunto contiene katakana para escribir el idioma japonés . Sin embargo, la marca de vocal larga japonesa , que se usa en texto katakana y se incluye en la fila 1 de JIS X 0208 , no está incluida. [ 20 ] Apple también incluye algunos marcadores de lista entre corchetes que continúan desde los de las filas 9 y 10. [ 16 ]
Compare la fila 11 de KPS 9566 , que utiliza el mismo diseño. Compare y contraste la fila 5 de JIS X 0208 , que también utiliza el mismo diseño, pero en una fila diferente.
Conjunto de caracteres 0x2C / 0xAC (fila número 12, cirílico)
Este conjunto contiene el alfabeto ruso moderno y no necesariamente es suficiente para representar otras formas de la escritura cirílica . Apple también incluye algunos marcadores de lista en recuadros negros. [ 16 ]
Compare la fila 5 de KPS 9566 y la fila 7 de JIS X 0208 , que utilizan la misma disposición (pero en una fila diferente).
Conjunto de caracteres extendido 0x2D / 0xAD (número de fila 13, puntuación adicional de Apple)
Conjuntos precompuestos de caracteres Hangul (filas 16 a 40)
Los puntos de código para el Hangul precompuesto se incluyen en un bloque ordenado continuo entre los puntos de código 16-01 y 40-94 inclusive. No todos los grupos de sílabas posibles se incluyen en este rango. Compare el orden y la disponibilidad diferentes en KPS 9566 .
Las sílabas iniciales + vocales + finales 뢨, 썅, 쏀, 쓩 y 쭁 están incluidas, pero sus contrapartes iniciales + vocales 뢔, 쌰, 쎼, 쓔 y 쬬 no lo están. Esto puede causar un problema con la entrada de datos, ya que los métodos de entrada deben pasar primero por una sílaba inicial + vocal para llegar a una sílaba inicial + vocal + final (por ejemplo, ㅎ → 하 → 한).
Los que no aparecen en esta lista pueden representarse mediante secuencias de composición de ocho bytes. El UHC asigna códigos a todos los demás clústeres modernos de jamo en otros lugares. Johab asigna códigos a todos los posibles clústeres modernos de jamo.
Estadísticas de jamo
Conjuntos de caracteres Hanja (filas número 42 a 93)
KS X 1001 codifica los caracteres hanja con múltiples pronunciaciones varias veces, una vez por cada pronunciación. (Algunas pronunciaciones provienen del chino medio y otras son consecuencia de la regla del sonido inicial ). Un carácter, 樂, se codifica cuatro veces. Los primeros 268 caracteres (U+F900–U+FA0B) del bloque de ideogramas de compatibilidad CJK corresponden a estas duplicaciones.
En la tabla siguiente, el valor (y la lectura) de la primera celda de la fila para cada Hanja se corresponde con el bloque de Ideogramas Unificados CJK ; los demás se corresponden con el bloque de Ideogramas de Compatibilidad CJK.
Codificación Johab

- Página : Hangul
- Página : Hanja
- 특수문자 : caracteres especiales (caracteres que no son Hangul ni Hanja)
Desde 1992, KS X 1001 también define una codificación alternativa conocida como Johab. Esta representa una sílaba Hangul como la secuencia de tres valores de cinco bits, divididos en dos bytes de 8 bits , con el bit más significativo primero. El bit más significativo del byte inicial siempre está activado (lo que permite la combinación con ASCII de un solo byte o KS X 1003 ). Esta codificación también se utiliza para el jamo moderno de la fila 4 de KS X 1001 , utilizando los valores de relleno para los demás componentes. La codificación Johab para Hangul se muestra en la tabla siguiente. [ 22 ]
Johab codifica el resto de KS X 1001 usando bytes iniciales que no corresponden a un jamo inicial (0xE0–0xF9 para Hanja y 0xD9–0xDE [ 23 ] para no Hanja, excluyendo sílabas Hangul y jamo moderno), con bytes finales en los rangos 0x31–0x7E y 0x91–0xFE. [ 22 ] Estos códigos se asignan algorítmicamente a partir de los puntos de código KS X 1001 de los caracteres, [ 23 ] con dos filas KS X 1001 por byte inicial (comparar y contrastar Shift JIS ).

La codificación Johab basada en ASCII está numerada como página de código 1361 por Microsoft. [ 24 ] También existen otras variantes de Johab definidas por el proveedor; por ejemplo, IBM define una para usar como un conjunto Shift Out con EBCDIC . Esa variante usa shift in y shift out para cambiar entre una página EBCDIC de un solo byte y Johab, usa una codificación diferente para los caracteres que no son Hangul (usando bytes iniciales 0x40–6C con una disposición diferente) y usa bytes iniciales 0xD4–DD como una región definida por el usuario , pero usa la misma disposición de Johab que el estándar de 1992 para los caracteres Hangul cuando está en estado shift-out. [ 25 ] IBM numera la codificación Johab con estado basada en EBCDIC como página de código 1364 , [ 25 ] y también define un subconjunto de esa codificación, que incluye menos caracteres Hangul pero en la misma disposición, como página de código 933. [ 26 ]
Algunos otros proveedores, como Samsung o GoldStar (ahora LG ), utilizaron otras codificaciones "Johab" donde las asignaciones de códigos de cinco bits a jamo difieren de las que se muestran a continuación, por lo que no son compatibles con el estándar Johab de 1992. [ af ] La tabla que aparece a continuación corresponde al estándar de 1992 y también al uso de IBM.
Por ejemplo, la sílaba Hangul 한 se codifica en 1 10100 00011 00101binario, que está D065en hexadecimal.
Código Hangul de N bytes
This is the N-byte Hangul code,[5] as specified by KS C 5601-1974 and by annex 4 of KS C 5601–1992. The second half of IBM's Code page 1040[27] is a superset of this, assigning the characters ¢¬\~ (although not £) to the same locations as in Code page 1041, while the unextended N-Byte Hangul (besides C0 control code replacement graphics in some usage contexts, shared with IBM-1040) is Code page 891.[28] Character 0x40/0xC0 is a Hangul Filler (see above), used in combining sequences.
Similarly to its Japanese counterpart JIS C 6220 (JIS X 0201), N-byte Hangul code could be used as a 7-bit encoding, with character allocations over the range 0x40 through 0x7C.[5] The chart below shows the code in an 8-bit environment with the high bit set (i.e. over 0xC0 through 0xFC), as it is used in e.g. code page 891 or 1040.
Footnotes
- ↑Missing Greek diacritics and final sigma.
- ↑Missing chōonpu, shinjitai, kokuji.
- 12Missing lowercase å, although the uppercase U+212BÅANGSTROM SIGN is included, as are both cases of Ø and Æ.
- ↑Korean: 정보 교환용 부호계 (한글 및 한자);RR: Jeongbo Gyohwannyong Buhogye (Hangeul mit Hanja)
- 12As a ISO 2022 compatible 94n-character set, the plain space and delete character are always available as single-byte codes at 0x20 and 0x7F (not 0xA0 and 0xFF) respectively.
- 123456789Mapped by Apple to a sequence of the ASCII digit, the combining square U+20DE, and the private-use character U+F87C.[16] Appearance shown here simulated.
- 1234567891011Mapped by Apple to an ASCII sequence with the number in square brackets, prefixed by the private-use character U+F863.[16] Appearance shown here simulated.
- ↑Narrower than 0xA2D2. Apple appends a private-use character U+F87F for round trip purposes.
- ↑Two vertical lines with right-hand line bolder. Apple maps this to the ordinary double vertical U+2016 (‖) plus a private-use character U+F87B for round trip purposes; U+1D102 is shown here to reflect the intended appearance.
- ↑Two vertical lines with left-hand line bolder. Apple maps this to the ordinary double vertical U+2016 (‖) plus a private-use character U+F87C for round trip purposes; U+1D103 is shown here to reflect the intended appearance.
- ↑Variant aligned to the bottom-left of the character cell, for horizontal use. Apple maps this to U+FF01+F874, where U+F874 is a private-use character used by Apple to tag the character for round-tripping purposes.[16] More recently,[18] a standardised variation sequence has been added for this form, using an appended Variation Selector 1 (U+FE00).[19]
- ↑Variant aligned to the bottom-left of the character cell, for horizontal use. Apple maps this to U+3002+F87D, where U+F87D is a private-use character used by Apple to tag the character for round-tripping purposes.[16] More recently,[18] a standardised variation sequence has been added for this form, using an appended Variation Selector 1 (U+FE00).[19]
- 12Duplicate, mapped by Apple with an appended private-use character U+F87F for round tripping.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3257+F87A, where U+F87A is a private-use character, and U+3257 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3258+F87A, where U+F87A is a private-use character, and U+3258 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3259+F87A, where U+F87A is a private-use character, and U+3259 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+325A+F87A, where U+F87A is a private-use character, and U+325A is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3251+F87A, where U+F87A is a private-use character, and U+3251 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3252+F87A, where U+F87A is a private-use character, and U+3252 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3253+F87A, where U+F87A is a private-use character, and U+3253 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3254+F87A, where U+F87A is a private-use character, and U+3254 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3255+F87A, where U+F87A is a private-use character, and U+3255 is the unfilled circled character.[16]
- ↑An exact match does note exist in Unicode, shown simulated. Apple maps to U+3256+F87A, where U+F87A is a private-use character, and U+3256 is the unfilled circled character.[16]
- 12345678910Mapped by Apple to an ASCII sequence, prefixed by the private-use character U+F862.[16]
- 123456789Mapped by Apple to a sequence of the ASCII digit, the combining square U+20DE, and the private-use character U+F875.[16] Appearance shown here simulated.
- 1234567891011Mapped by Apple to an ASCII sequence with the number in square brackets, prefixed by the private-use character U+F866.[16] Appearance shown here simulated.
- 1234These largely duplicate characters in row 1. Apple describes them as "long" versions, and appends the private-use character U+F879 for round-tripping purposes.[16]
- 1234The MacKorean encoding also includes several sets of differently styled arrows (including white arrows) outside of the KS X 1001 plane ranges, with lead bytes 0xA8 and 0xAC, and trail bytes between 0x41 and 0xA0. Apple appends the private-use character U+F878 to this particular set of white arrows for round-tripping purposes.[16]
- 12Unlike those in row 1, these two marks are intended to display in low position (similarly to U+301F). Apple appends the private-use character U+F873 to distinguish them.[16]
- ↑Apple maps this to U+21E7+F87F, where U+21E7 is the white up arrow[16] and U+F87F is a private-use character, although this character is a black arrow.[21] The character shown is a Unicode character which postdates Apple's mapping table, and resembles the glyph[21] for this MacKorean character.
- ↑Apple maps this to a sequence of the ASCII exclamation mark followed by the private-use character U+F87F.[16]
- ↑Some mappings for these encodings are available here.
- 1234Were this one used, it would result in a trail byte in the C0 control codes range.
- 1234Were this one used, it would result in trail bytes in the 0x2_ and 0x3_ rows of ASCII. Johab does not use the 0x2_ row for trail bytes, similarly to most common legacy CJK encodings (compare Shift JIS, GBK, Big5). The EBCDIC-based version of Johab does not use trail bytes from either row, due to them being in the EBCDIC control code range.
References
- 12345Lunde, Ken (2009). "Chapter 3: Character Set Standards". CJKV Information Processing. O'Reilly Media, Inc. pp. 143–148. ISBN 978-0596514471.
- 123456Hwang, Jinsang (2005). The Social Shaping of ICTs Standards: A Case of National Coded Character Set Standards Controversy in Korea(PDF). University of Edinburgh.
- 123Lunde, Ken (1995-12-18). "2.4.6: Obsolete Standards". CJK.INF Version 1.9.
- 12Shin, Jungshik. "What are KS X 1001(KS C 5601) and other Hangul codes?". Hangul & Internet in Korea FAQ.
- 1234Lunde, Ken (1995-12-18). "3.3.6: N-byte Hangul". CJK.INF Version 1.9.
- 12"INFO: Hangul (Korean) Character Sets", Microsoft Support, Microsoft
- 12Zsigri, Gyula (2002-06-18). "KSC and UHC".
- ↑Chang, Hye-Shik (28 November 2021). "cpython/Modules/cjkcodecs/_codecs_kr.c (revision d3faf43)". cPython source tree. Python Software Foundation.
- 123Chung, Jaemin (2017-03-30). Proposal to add an informative note to U+3164 HANGUL FILLER(PDF). Unicode Consortium. UTC L2/17-081.
- 12Korea Bureau of Standards (1988-10-01). Korean Graphic Character Set for Information Interchange(PDF). ITSCJ/IPSJ. ISO-IR-149.
- ↑"ibm-1363_P110-1997 (lead byte A1)". ICU Demonstration - Converter Explorer. International Components for Unicode / Unicode Consortium.
- ↑"euc-kr (lead byte A1)". ICU Demonstration - Converter Explorer. International Components for Unicode.
- 1234"Map (external version) from Mac OS Korean encoding to Unicode 3.2 and later". Apple.
- ↑"windows-949-2000 (lead byte A1)". ICU Demonstration - Converter Explorer. International Components for Unicode / Unicode Consortium.
- 1234"Lead Byte A1-A2 (Code page 949)". MSDN. Microsoft. 6 February 2008.
- 12345678910111213141516171819202122232425262728293031Apple (2005-04-05). "Map (external version) from Mac OS Korean encoding to Unicode 3.2 and later". Unicode Consortium.
- ↑"windows-949-2000 (lead byte A2)". ICU Demonstration - Converter Explorer. International Components for Unicode / Unicode Consortium.
- 12Lunde, Ken (2018-01-21). "Proposal to add standardized variation sequences for fullwidth East Asian punctuation"(PDF). UTC L2/17-436.
- 12"StandardizedVariants.txt: Standardized Variation Sequences". Unicode Character Database. Unicode Consortium.
- ↑Lunde, Ken (2009). "Seemingly Missing Characters". CJKV Information Processing: Chinese, Japanese, Korean & Vietnamese Computing (2nd ed.). Sebastopol, CA: O'Reilly. p. 180. ISBN 978-0-596-51447-1.
- 12Lunde, Ken (2009). "Appendix E: Vendor Character Set Standards"(PDF). CJKV Information Processing: Chinese, Japanese, Korean & Vietnamese Computing (2nd ed.). Sebastopol, CA: O'Reilly. ISBN 978-0-596-51447-1.
- 123Lunde, Ken (2008). "Chapter 4: Encoding Methods (§ Johab Encoding—KS X 1001:2004)". CJKV Information Processing (2nd ed.). Sebastopol, California: O'Reilly Media. pp. 268–273. ISBN 978-0-596-51447-1.
- 12Shin, Jungshik (2011-10-14) [1999-08-16]. Johab to Unicode table. Unicode Consortium.
- ↑"Code Page Identifiers". Windows Dev Center. Microsoft. 7 January 2021.
- 12"ibm-1364_P110-2007". International Components for Unicode. Unicode Consortium.
- ↑"ibm-933_P110-1995". International Components for Unicode. Unicode Consortium.
- ↑"Code Page 01040"(PDF). IBM. Archived(PDF) from the original on 2015-07-08.
- ↑"Code Page 00891"(PDF). IBM. Archived(PDF) from the original on 2015-07-08.
- ↑"KSRI-87-37-IR: 한글·한자 코드 표준화에 관한 연구: A Study on Standardization of Hangul and Hanja Codes"(PDF) (in Korean). Ministry of Science and Technology. 1987. p. 68. Archived from the original(PDF) on 2019-03-01.
External links
- What are KS X 1001(KS C 5601) and other Hangul codes?
- Implementing Cross-Locale CJKV Code Conversion by Ken Lunde
- Unicode mapping tables for Wansung and Johab encodings:
- IBM code page 970 (Wansung, EUC-KR format)
- Windows code page 949 (Unified Hangul Code / Extended Wansung)
- Windows code page 1361 (Johab, ASCII-based version)
- IBM code page 1364 (Johab, EBCDIC-based version)
- Codificaciones de lenguas asiáticas
- Informática en idioma coreano
- Hangul
- Introducciones relacionadas con la informática en 1987
- Normas de Corea del Sur