JIS X 0208 es un conjunto de caracteres de 2 bytes especificado como estándar industrial japonés , que contiene 6879 caracteres gráficos adecuados para escribir texto, nombres de lugares, nombres personales, etc. en el idioma japonés . El título oficial del estándar actual es conjuntos KANJI codificados de doble byte de 7 y 8 bits para el intercambio de información ( 7ビット及び8ビットの2バイト情報交換用符号化漢字集合, Nana-Bitto Oyobi). Hachi-Bitto no Ni-Baito Jōhō Kōkan'yō Fugōka Kanji Shūgō ) . Originalmente se estableció como JIS C 6226 en 1978 y se revisó en 1983, 1990 y 1997. IBM también la denomina página de código 952. La versión de 1978 también se conoce como página de código 955 por IBM.
Ámbito de uso y compatibilidad
El conjunto de caracteres que establece JIS X 0208 tiene como finalidad principal el intercambio de información (情報交換, jōhō kōkan ) entre sistemas de procesamiento de datos y los dispositivos conectados a ellos, o entre sistemas de comunicación de datos. Este conjunto de caracteres puede utilizarse para el procesamiento de datos y texto.
Las implementaciones parciales del conjunto de caracteres no se consideran compatibles. Dado que existen casos en los que esto ha ocurrido, como cuando el comité de redacción original del primer estándar se aseguró de separar los caracteres entre el nivel 1 y el nivel 2, y el segundo estándar luego mezcló algunos caracteres variantes (異体字, itaiji ) entre los niveles, al menos en el primer y segundo estándar, se conjetura que en algún momento se consideró el desarrollo de sistemas informáticos japoneses con implementaciones que no utilizaban kanji y que solo admitían el nivel 1. Sin embargo, dichas implementaciones nunca se han especificado como compatibles, aunque existieron ejemplos como el antiguo NEC PC-9801 . [ 1 ]
Aunque la norma JIS X 0208:1997 contiene disposiciones sobre compatibilidad, actualmente se considera que no certifica la compatibilidad ni constituye una norma oficial de fabricación que equivalga a una declaración de autocompatibilidad. [ 2 ] En consecuencia, de facto , no se considera que existan productos compatibles con JIS X 0208. La norma JIS X 0208 incluye términos como «conforme» (準拠, junkyo ) y «soporte» (対応, taiō ) , pero su significado varía según la persona.
Diagramas de códigos
byte principal
El primer byte de codificación corresponde al número de fila o celda más 0x20, o 32 en decimal (véase más abajo). Por lo tanto, el conjunto de códigos que comienza con 0x21 tiene un número de fila de 1, y su celda 1 tiene un byte de continuación de 0x21 (o 33), y así sucesivamente.
Para los bytes iniciales utilizados para caracteres distintos de los kanji , se proporcionan enlaces a tablas en esta página que enumeran los caracteres codificados bajo ese byte inicial. Para los bytes iniciales utilizados para kanji, se proporcionan enlaces a la sección correspondiente del índice de kanji de Wikcionario .
Filas que no son kanji
Conjunto de caracteres 0x21 (número de fila 1, caracteres especiales)
Algunos proveedores utilizan una asignación Unicode ligeramente diferente para este conjunto que la que se muestra a continuación. Por ejemplo, Microsoft asigna kuten 1-29 (JIS 0x213D) a U+2015 (barra horizontal), [ 3 ] mientras que Apple lo asigna a U+2014 (raya larga). [ 4 ] De manera similar, Microsoft asigna kuten 1-61 (JIS 0x215D) a U+FF0D [ 3 ] (la forma de ancho completo de U+002D guion-menos), y Apple lo asigna a U+2212 (signo menos). [ 4 ] La asignación Unicode de la raya ondulada también difiere entre proveedores. Consulte las celdas con notas al pie a continuación.
La puntuación ASCII y JISCII (que se muestra aquí con un fondo amarillo) puede usar asignaciones alternativas al bloque de formas de ancho medio y ancho completo si se usa en una codificación que combine JIS X 0208 con ASCII o con JIS X 0201 , como Shift JIS , EUC-JP o ISO 2022-JP .
Conjunto de caracteres 0x22 (fila número 2, caracteres especiales)
La mayoría de los caracteres de este conjunto se añadieron en 1983, a excepción de los caracteres 0x2221 – 0x222E (kuten 2-1 a 2-14, o la primera línea de la tabla que aparece a continuación), que se incluyeron en la versión original de 1978 del estándar.
Conjunto de caracteres 0x23 (fila número 3, dígitos y caracteres romanos)
Este conjunto incluye un subconjunto del conjunto invariante ISO 646 (y, por lo tanto, también un subconjunto de ASCII y del conjunto romano JIS X 0201 ), sin signos de puntuación ni símbolos, que comprende los números arábigos occidentales y ambos casos del alfabeto latino básico . Los caracteres de este conjunto pueden usar asignaciones Unicode alternativas al bloque de formas de ancho medio y ancho completo si se usan en una codificación que combine JIS X 0208 con ASCII o con JIS X 0201, como EUC-JP , Shift JIS o ISO 2022-JP .
Compare la fila 3 de KPS 9566 , que coincide exactamente con esta fila. Compare y contraste la fila 3 de KS X 1001 y de GB 2312 , que incluyen sus variantes nacionales completas de ISO 646 en esta fila, en lugar de solo el subconjunto alfanumérico.
Conjunto de caracteres 0x24 (fila número 4, Hiragana)
Esta fila contiene caracteres hiragana japoneses .
Compare la fila 4 de GB 2312 , que coincide con esta fila. Compare y contraste la fila 10 de KPS 9566 y de KS X 1001 , que utilizan el mismo diseño, pero en una fila diferente.
Conjunto de caracteres 0x25 (fila número 5, Katakana)
Esta fila contiene caracteres katakana japoneses .
Compare la fila 5 de GB 2312 , que coincide con esta fila. Compare y contraste la fila 11 de KPS 9566 y de KS X 1001 , que usan el mismo diseño, pero en una fila diferente. Contraste el diseño Katakana considerablemente diferente utilizado por JIS X 0201 .
Conjunto de caracteres 0x26 (fila número 6, griego)
Esta fila contiene soporte básico para el alfabeto griego moderno , sin diacríticos ni la sigma final .
Compare la fila 6 de GB 2312 y GB 12345 con la fila 6 de KPS 9566 , que incluyen las mismas letras griegas en el mismo diseño, aunque GB 12345 añade formatos de presentación vertical y KPS 9566 añade números romanos. Compare y contraste la fila 5 de KS X 1001 , que desplaza las letras griegas para incluir primero los números romanos.
Conjunto de caracteres 0x27 (fila número 7, cirílico)
Esta fila contiene el alfabeto ruso moderno y no es necesariamente suficiente para representar otras formas de la escritura cirílica .
Compare la fila 7 de GB 2312 , que coincide con esta fila. Compare y contraste la fila 12 de KS X 1001 y la fila 5 de KPS 9566 , que utilizan el mismo diseño (pero en una fila diferente).
Conjunto de caracteres 0x28 (número de fila 8, dibujo de caja)
Todos los personajes de este conjunto se añadieron en 1983 y no estaban presentes en la revisión original de 1978 del estándar.
Conjunto de caracteres de extensión 0x2D (número de fila 13, caracteres especiales NEC)
Las filas 9 a 15 de la norma JIS X 0208 se dejan en blanco.
Sin embargo, el siguiente diseño para la fila 13, introducido por primera vez por NEC , es una extensión común. Es utilizado (con variaciones menores, indicadas en las notas al pie) por Windows-932 [ 3 ] (que coincide con el estándar de codificación WHATWG utilizado por HTML5 ), por la variante PostScript (pero, desde KanjiTalk versión 7, no la variante regular) [ 5 ] de MacJapanese , y por JIS X 0213 (el sucesor de JIS X 0208). [ 5 ] [ 6 ] A diferencia de las otras extensiones hechas por Windows-932/WHATWG y JIS X 0213, las dos coinciden en lugar de entrar en conflicto, por lo que la decodificación de la mayor parte de esta fila está mejor soportada que las otras extensiones hechas por JIS X 0213.
Filas de kanjis
Estructura del código
Para representar los puntos de código , se utilizan números de columna/línea para los códigos de un byte y números kuten para los códigos de dos bytes. Para identificar un carácter sin depender de un código, se utilizan nombres de caracteres.
Códigos de un solo byte
Casi todos los códigos de caracteres gráficos JIS X 0208 se representan con dos bytes de al menos siete bits cada uno. Sin embargo, cada carácter de control , así como el espacio simple ( aunque no el espacio ideográfico ), se representa con un código de un byte. Para representar la combinación de bits (ビット組合せ, bitto kumiawase ) de un código de un byte, se utilizan dos números decimales: un número de columna y un número de línea . Tres bits de orden superior de siete o cuatro bits de orden superior de ocho, contando de cero a siete o de cero a quince respectivamente, forman el número de columna. Cuatro bits de orden inferior, contando de cero a quince, forman el número de línea. Cada número decimal corresponde a un dígito hexadecimal . Por ejemplo, la combinación de bits correspondiente al carácter gráfico "espacio" es 010 0000 como un número de 7 bits, y 0010 0000 como un número de 8 bits. En notación de columna/línea, esto se representa como 2/0. Otras representaciones del mismo código de un solo byte incluyen 0x20 como hexadecimal o 32 como un único número decimal.
Puntos de código y números de código
Los códigos de doble byte están organizados en 94 grupos numerados, cada uno llamado fila (区, ku ; lit. "sección") . Cada fila contiene 94 códigos numerados, cada uno llamado celda (点, ten ; lit. "punto") . [ j ] Esto hace un total de 8836 (94 × 94) posibles puntos de código (aunque no todos están asignados, véase más abajo); estos están organizados en el estándar en una tabla de códigos de 94 líneas y 94 columnas.
Un número de fila y un número de celda (cada uno numerado del 1 al 94, para un código JIS X 0208 estándar) forman un punto kuten (区点) , que se utiliza para representar puntos de código de doble byte. Un número de código o número kuten (区点番号, kuten bangō ) se expresa en el formato "fila-celda", separando los números de fila y celda con un guion . Por ejemplo, el carácter "亜" tiene un punto de código en la fila 16, celda 1, por lo que su número de código se representa como "16-01".
En JIS X 0208 de 7 bits (como podría cambiarse en JIS X 0202 / ISO-2022-JP ), ambos bytes deben estar en el rango de 94 bytes de 0x21 (usado para la fila o celda número 1) a 0x7E (usado para la fila o celda número 94) , que corresponde exactamente al rango utilizado para los caracteres de impresión ASCII de 7 bits, sin contar el espacio. En consecuencia, los bytes codificados se obtienen sumando 0x20 (32) a cada número. [ 7 ] Por ejemplo, el ejemplo anterior de 16-01 ("亜") estaría representado por los bytes . El EUC-JP0x30 0x21 de 8 bits en cambio usa el rango 0xA1 a 0xFE (estableciendo el bit más alto en 1), mientras que otras codificaciones como Shift JIS usan transformaciones más complicadas. Shift JIS incluye más espacio de codificación del que se necesita para JIS X 0208 en sí; Algunas extensiones específicas de Shift JIS para JIS X 0208 utilizan números de fila superiores a 94. [ 8 ]
Esta estructura también se utiliza en el chino continental GB 2312 , donde se conoce de forma nativa como区位; qūwèi , y en el surcoreano KS C 5601 (actualmente KS X 1001 ), donde ku y ten se conocen respectivamente como hang [ 9 ] ( 행 ;行; haeng ) y yol [ 9 ] ( 열 ;列; yeol ). El posterior JIS X 0213 extiende esta estructura al tener más de un plano (面, men ; lit. "cara") de filas, que también es la estructura utilizada por CNS 11643 y está relacionada con la estructura utilizada por CCCII .
Puntos de código no asignados
Entre los códigos de 2 bytes, las filas 9 a 15 y 85 a 94 son puntos de código sin asignar (空き領域, aki ryōiki ) ; es decir, son puntos de código sin caracteres asignados. Asimismo, algunas celdas de otras filas también son esencialmente puntos de código sin asignar.
Estas áreas vacías contienen puntos de código que, en principio, no deberían utilizarse. Salvo acuerdo previo entre las partes implicadas, no se deben asignar caracteres ( gaiji ) para el intercambio de información a los puntos de código no asignados.
Incluso al asignar caracteres a puntos de código no asignados, no se deben asignar caracteres gráficos definidos en el estándar, ni se debe asignar el mismo carácter a varios puntos de código no asignados; los caracteres no deben duplicarse en el conjunto.
Además, al asignar caracteres a puntos de código no asignados, es necesario tener cuidado con la unificación respecto a los glifos kanji. Por ejemplo, la fila 25, celda 66, corresponde al kanji que significa "alto" o "caro"; tanto la forma con un componente que se asemeja al carácter de "boca" (口) en el medio (高) como la forma menos común con una construcción similar a una escalera en la misma ubicación (髙) se incluyen en el mismo punto de código. En consecuencia, limitar el punto 25-66 a la forma de "boca" y asignar la forma posterior de "escalera" a un punto de código no asignado constituiría, técnicamente, una violación del estándar.
En la práctica, sin embargo, varias variantes de Shift JIS específicas de cada proveedor , incluidas Windows-932 y MacJapanese , codifican las extensiones del proveedor en filas no asignadas del espacio de codificación para JIS X 0208. Además, la mayoría de los códigos no asignados en JIS X 0208 son asignados por el estándar más reciente JIS X 0213 .
Nombres de personajes
Cada carácter JIS X 0208 tiene un nombre . Al usar el nombre de un carácter, es posible identificarlo sin depender de su código. Los nombres de los caracteres están coordinados con otros estándares de conjuntos de caracteres, en particular el Conjunto Universal de Caracteres Codificados (UCS/ Unicode ), por lo que esta es una posible fuente de mapeo de caracteres a conjuntos de caracteres como Unicode. Por ejemplo, tanto el carácter en la columna 4, línea 1 de la Versión de Referencia Internacional ISO/IEC 646 ( US-ASCII ) como el de la fila 3, celda 33 de JIS X 0208 tienen el nombre "LETRA MAYÚSCULA LATINA A". Por lo tanto, el carácter en la posición 4/1 en ASCII y el carácter en las posiciones 3-33 en JIS X 0208 pueden considerarse el mismo carácter (aunque, en la práctica, se utiliza un mapeo alternativo para el carácter JIS X 0208 debido a que las codificaciones proporcionan ASCII por separado). Por el contrario, se puede determinar que los caracteres ASCII 2/2 (comillas), 2/7 (apóstrofe), 2/13 (guion menos) y 7/14 (tilde) son caracteres que no existen en este estándar.
Los nombres de los caracteres que no son kanji usan letras romanas mayúsculas, espacios y guiones. A los caracteres que no son kanji se les da un nombre común en japonés (日本語通用名称, Nihongo tsūyō meishō ) , pero algunas disposiciones para estos nombres no existen. [ k ] Los nombres de los kanji, por otro lado, se establecen mecánicamente de acuerdo con la representación hexadecimal correspondiente de su código en UCS/Unicode. El nombre de un kanji se puede obtener anteponiendo al punto de código Unicode "CJK UNIFIED IDEOGRAPH-". Por ejemplo, la fila 16 celda 1 (亜) corresponde a U+4E9C en UCS, por lo que su nombre sería "CJK UNIFIED IDEOGRAPH-4E9C". A los kanji no se les dan nombres comunes en japonés.
Conjunto de kanji
Descripción general
La norma JIS X 0208 prescribe un conjunto de 6879 caracteres gráficos que corresponden a códigos de dos bytes con siete u ocho bits por byte; en JIS X 0208, esto se denomina conjunto de kanji (漢字集合, kanji shūgō ) , que incluye 6355 kanji, así como 524 caracteres no kanji (非漢字, hikanji ) , incluidos caracteres como letras latinas , kana , etc.
- Personajes especiales
- Ocupa las filas 1 y 2. Hay 18 símbolos descriptores (記述記号, kijutsu kigō ) como el "espacio ideográfico" ( ), y la coma y el punto japoneses ; ocho signos diacríticos como dakuten y handakuten ; 10 caracteres para cosas que siguen a kana o kanji (仮名又は漢字に準じるもの, kana mata wa kanji ni junjiru mono ) , como la marca de iteración ; 22 símbolos entre corchetes (括弧記号, kakko kigō ) ; 45 símbolos matemáticos (学術記号, gakujutsu kigō ) ; y 32 símbolos de unidades , que incluyen el símbolo de la moneda y el sello postal , para un total de 147 caracteres.
- Números
- Ocupa parte de la fila 3. Los diez dígitos del "0" al "9".
- letras latinas
- Ocupa parte de la fila 3. Las 26 letras del alfabeto inglés en mayúsculas y minúsculas forman un total de 52.
- Hiragana
- Ocupa la fila 4. Contiene 48 kana sordos (incluidos los obsoletos wi y we ), 20 kana sonoros ( dakuten ), 5 kana semisonoros ( handakuten ), 10 kana pequeños para sonidos palatalizados y asimilados, para un total de 83 caracteres.
- Katakana
- Ocupa la fila 5. Hay 86 caracteres; además de los equivalentes katakana de los caracteres hiragana, el ka / ke kana pequeño (ヵ/ヶ) y el vu kana (ヴ).
- letras griegas
- Ocupa la fila 6. Las 24 letras del alfabeto griego en mayúsculas y minúsculas (menos la sigma final ) para un total de 48.
- letras cirílicas
- Ocupa la fila 7. Las 33 letras del alfabeto ruso en mayúsculas y minúsculas forman un total de 66.
- Personajes de dibujo de cajas
- Ocupa la fila 8. Segmentos delgados, segmentos gruesos y segmentos mixtos delgados y gruesos, 32 en total.
- Kanji
- Los 2965 caracteres del nivel 1 (第1水準, dai ichi suijun ) de la fila 16 a la fila 47, y los 3390 caracteres del nivel 2 (第2水準, dai ni suijun ) de la fila 48 a la fila 84 para un total de 6355.
Caracteres especiales, números y caracteres latinos
En cuanto a los caracteres especiales del conjunto kanji, algunos caracteres del conjunto de caracteres gráficos de la Versión de Referencia Internacional (IRV) de ISO/IEC 646 :1991 (equivalente a ASCII ) no están presentes en JIS X 0208. Se trata de los cuatro caracteres mencionados anteriormente: «COMILLAS», «APÓSTROFO», «GUIÓN-MIN» y «TILDE». Los tres primeros se dividen en diferentes puntos de código en el conjunto kanji (Nishimura, 1978; norma JIS X 0221-1:2001, Sección 3.8.7). La «TILDE» de IRV no tiene un carácter correspondiente en el conjunto kanji.
En la siguiente tabla, los caracteres IRV de la norma ISO/IEC 646:1991 en cuestión se comparan con sus múltiples equivalentes en la norma JIS X 0208, excepto el carácter IRV "TILDE", que se compara con el "WAVE DASH" de la norma JIS X 0208. Las entradas de las columnas "Símbolo" utilizan puntos de código UCS/Unicode, por lo que la visualización puede variar.
Los caracteres ASCII/IRV que no tenían equivalentes exactos en JIS X 0208 recibieron posteriormente puntos de código según JIS X 0213 ; estos también se enumeran a continuación, al igual que la asignación de Microsoft para los cuatro caracteres.
- 1 2 De "Selección de extensiones de IBM de NEC". Ocupa un punto de código no asignado en JIS X 0208.
- 1 2 De "Extensiones de IBM". Fuera del rango de JIS X 0208, pero codificable en Shift_JIS.
- ↑ Microsoft trata el signo menos de JIS como una forma de ancho completo del guion menos.
- 1 2 Wave Dash a veces se trata como una forma de ancho completo de la tilde, por ejemplo por Microsoft (ver Tilde § Codificación Unicode y Shift JIS de wave dash ). La tilde ASCII / IRV es un punto de código ambiguo que puede aparecer como un acento de tilde (˜) o como un guion con la misma curvatura (∼), aunque el guion es más común debido a que el acento de espaciado tiene un punto de código separado en Windows-1252 ; no hay un carácter JIS X 0208 para un acento de tilde. El carácter 1-2-18 en JIS X 0213 se muestra como un acento de tilde en la tabla de códigos. [ 6 ]
Esto significa que el conjunto de caracteres kanji es el conjunto de caracteres no compatible con versiones superiores más extendido del mundo; se considera uno de los puntos débiles de este estándar.
Incluso con los 90 caracteres especiales, números y letras latinas que tienen en común el conjunto kanji y el conjunto IRV, esta norma no sigue la disposición de ISO/IEC 646. Estos 90 caracteres se dividen entre las filas 1 (puntuación) y 3 (letras y números), aunque la fila 3 sí sigue la disposición de ISO 646 solo para las 62 letras y números (por ejemplo, 4/1("A") en ISO 646 se convierte en 2/3 4/1(ie 3-33) en JIS X 0208).
En cuanto a la causa de que estos numerales, letras latinas, etc., en el conjunto de kanji sean los "caracteres alfanuméricos de ancho completo" (全角英数字, zenkaku eisūji ) y de que la implementación original presentara una interpretación diferente en comparación con la IRV, se cree que se debe a estas incompatibilidades.
Desde el primer estándar, ha sido posible representar compuestos (合成, gōsei ) como números encerrados en un círculo , ligaduras para nombres de unidades de medida y números romanos ; [ 10 ] no se les asignaron puntos de código kuten independientes . Aunque las empresas individuales que fabrican sistemas de información pueden esforzarse por representar estos caracteres según lo requieran los clientes mediante la composición de los caracteres, ninguna ha solicitado que se agreguen al estándar, optando en cambio por ofrecerlos de forma propietaria como gaiji .
En la cuarta norma (1997), todos estos caracteres se definieron explícitamente como caracteres que acompañan un avance de la posición actual; es decir, son caracteres de espaciado . Además, se dictaminó que no debían formarse mediante la composición de caracteres. Por este motivo, se prohibió representar caracteres latinos con diacríticos , con la posible única excepción del símbolo ångström ( Å ) en la fila 2, celda 82.
Hiragana y katakana
En la norma JIS X 0208, a diferencia de la JIS X 0201 , los caracteres hiragana y katakana incluyen las marcas dakuten y handakuten como parte de cada carácter. También se incluyen los caracteres katakana wi (ヰ) y we (ヱ) (ambos en desuso en el japonés moderno), así como el pequeño wa (ヮ) , ausente en la JIS X 0201.
La disposición de kana en JIS X 0208 es diferente de la disposición de katakana en JIS X 0201. En JIS X 0201, el silabario comienza con wo (ヲ) , seguido por el kana pequeño ordenado por orden de gojūon , seguido por el kana de tamaño completo, también en orden de gojūon. (ヲァィゥェォャュョッーアイウエオ......ラリルレロワン). Por otro lado, en JIS X 0208, los kana se clasifican primero por orden de gojūon , luego en el orden de "kana pequeña, kana de tamaño completo, kana con dakuten y kana con handakuten", de modo que el mismo kana fundamental se agrupa con sus derivados. (ぁあぃいぅうぇえぉお......っつづ......はばぱひびぴふぶぷへべぺほぼぽ......ゎわゐゑをん). Este orden se eligió para facilitar más simplemente la clasificación de las búsquedas en diccionarios basados en kana (Yasuoka, 2006). [ l ]
Como se mencionó anteriormente, en esta norma, el orden de katakana definido previamente en JIS X 0201 no se siguió en JIS X 0208. Se cree que el uso de katakana de ancho reducido en JIS X 0201 se debió a la incompatibilidad con el katakana de esta norma. Este punto también constituye una de las debilidades de dicha norma.
Kanji
En el cuarto estándar (1997) se explica detalladamente cómo se seleccionaron los kanji de este estándar, por qué se dividen en nivel 1 y nivel 2, y cómo están organizados. Según dicha explicación, los kanji incluidos en las siguientes cuatro listas se corresponden con los 6349 caracteres del primer estándar (1978).
- Listado de kanji para código estándar (provisional) (標準コード用漢字表 (試案) , Hyōjun Kōdo-yō Kanjihyō (Shian) ) El comité de códigos kanji de la Sociedad de Procesamiento de Información de Japón compiló esta lista en 1971. En los "Resultados del análisis de correspondencia" que aparecen a continuación, parece tener 6086 caracteres.
- Kanji básico para uso de procesamiento de datos administrativos (行政情報処理用基本漢字, Gyōsei Jōhō Shoriyō Kihon Kanji ) Seleccionado por la Agencia de Gestión Administrativa de Japón en 1975, consta de 2817 caracteres. Para los datos con fines de selección, la Agencia elaboró un informe que, comenzando con el "Listado de kanji para el código estándar (provisional)", contrastaba varios listados de kanji, los "Resultados del análisis de correspondencia y frecuencia de uso de kanji para el procesamiento de datos administrativos Utilice la selección de kanji normal" (行政情報処理用標準漢字選定のための漢字の使用頻度および対応分析結果, Gyōsei Jōhō Shoriyō Kihon Kanji Sentei no Tame no Kanji no Shiyō Hindo Oyobi Taiō Bunseki Kekka ) , o "Resultados del análisis de correspondencia" (対応分析結果, Taiō Bunseki Kekka ) para abreviar.
- Kanji del Registro de Personalidad Japonesa (日本生命収容人名漢字, Nihon Seimei Shūyō Jinmei Kanji ). Una de las listas de kanji que componen los "Resultados del Análisis de Correspondencia", que consta de 3044 caracteres. Ya no existe. La lista original no existía para el comité de redacción original; esta lista de kanji se reflejó en el estándar que siguió a los "Resultados del Análisis de Correspondencia".
- Kanji para listado de distritos administrativos nacionales (国土行政区画総覧使用漢字, Kokudo Gyōsei Kukaku Sōran Shiyō Kanji ) Uno de los listados de kanji que componen los "Resultados del análisis de correspondencia", que consta de 3251 caracteres. Son los kanji utilizados en la lista de todos los nombres de lugares administrativos compilada por el Centro de Datos Geográficos de Japón , el "Listado de Distritos Administrativos Nacionales" (国土行政区画総覧, Kokudo Gyōsei Kukaku Sōran ) . El comité de redacción original no investigó la inclusión en sí; los kanji utilizados en esta lista siguieron los "Resultados del análisis de correspondencia".
En el segundo y tercer estándar, se añadieron cuatro y dos caracteres al nivel 2, respectivamente, lo que elevó el total de kanji a 6355. Asimismo, en el segundo estándar se modificaron las formas de los caracteres y se realizó una transposición entre los niveles; en el tercer estándar también se modificaron las formas de los caracteres. Estos cambios se describen con más detalle a continuación.
Particionamiento de niveles
Los 2.965 kanji de nivel 1 ocupan las filas 16 a 47. Los 3.390 kanji de nivel 2 ocupan las filas 48 a 84.
Para el nivel 1, se eligieron caracteres comunes a múltiples listados de glifos kanji, utilizando el kanji tōyō , el borrador de corrección del kanji tōyō y el kanji jinmeiyō como base. Además, se consultaron JIS C 6260 ("Código de identificación de To-Do-Fu-Ken (Prefectura)"; actualmente JIS X 0401 ) y JIS C 6261 ("Código de identificación para ciudades, pueblos y aldeas"; actualmente JIS X 0402 ); los kanji de casi todas las prefecturas , ciudades, distritos, barrios, pueblos, aldeas, etc., japonesas se colocaron intencionalmente en el nivel 1. [ m ] Además, se agregaron enmiendas de expertos.
El nivel 2 estaba dedicado a los kanji que aparecían en las cuatro listas principales mencionadas anteriormente, pero que no fueron seleccionados para el nivel 1. Como se indica más adelante, los kanji del nivel 1 estaban ordenados según su pronunciación, por lo que entre los kanji cuya pronunciación era difícil de determinar, algunos fueron transferidos del nivel 1 al nivel 2 en función de ello (Nishimura, 1978).
Debido a estas decisiones, en su mayor parte, el nivel 1 contiene kanji de uso más frecuente, y el nivel 2 contiene kanji de uso menos frecuente, pero por supuesto, estos fueron juzgados según los estándares de la época; con el paso del tiempo, algunos kanji de nivel 2 se han vuelto más frecuentes, como uno que significa "elevarse" (翔) y otro que significa "brillar" (煌); e inversamente, algunos kanji de nivel 1 se han vuelto poco frecuentes, en particular los que significan "centímetro" (糎) y "milímetro" (粍). De los kanji jōyō actuales , 30 caen en el nivel 2, [ n ] mientras que tres faltan por completo (塡󠄀, 剝󠄀 y 頰󠄀). [ o ] De los kanji jinmeiyō actuales , 192 están en el nivel 2, [ p ] mientras que 105 no forman parte del estándar. [ q ]
Acuerdo
Los kanji del nivel 1 se ordenan según la "lectura representativa" de cada uno (es decir, una lectura canónica elegida solo para los fines de esta norma); la lectura de un kanji para esto puede ser una lectura on o una lectura kun ; las lecturas se ordenan en orden gojūon . [ r ] Como regla general, la lectura on (sonido chino) se considera la lectura representativa; cuando un kanji tiene múltiples lecturas on , la lectura que se considera predominante en frecuencia de uso se utiliza como lectura representativa (norma JIS C 6226-1978, Sección 3.4). Para el pequeño porcentaje de kanji que no tienen una lectura on o tienen una lectura on que es poco conocida y no de uso común, se empleó la lectura kun como lectura representativa. Cuando se debe usar una lectura kun de verbo como lectura representativa, se usa la forma ren'yōkei (en lugar de la shūshikei ).
Por ejemplo, las celdas 1 a 41 en la fila 16 son 41 caracteres ordenados según comiencen con una lectura de a . Dentro de estos, 22 caracteres, incluidos 16-10 (葵: lectura on " ki "; lectura kun " aoi ") y 16-32 (粟: lecturas on " zoku " y " shoku "; lectura kun " awa ") están allí en base a sus lecturas kun . 16-09 (逢: lectura on " hō ", lectura kun " a(i) ") y 16-23 (扱: lecturas on " sō " y " kyū ", lectura kun " atsuka(i) ") son solo dos ejemplos de verbos en forma ren'yōkei utilizados para la lectura representativa.
Cuando la lectura representativa es la misma para diferentes kanji, un kanji que utiliza la lectura on se coloca antes que uno que utiliza la lectura kun . Cuando las lecturas on o kun son iguales para más de un kanji, se ordenan según su radical principal y el número de trazos .
Tanto en el nivel 1 como en el nivel 2, los itaiji se disponen siguiendo directamente su forma ejemplar. Por ejemplo, en el nivel 2, justo después de la fila 49, celda 88 (劍), los caracteres que siguen inmediatamente se desvían de la regla general (el número de trazos en este caso) para incluir tres variantes de 49-88 (劔,劒y剱). [ s ]
Los kanji del nivel 2 están ordenados según su radical primario y el número de trazos. Cuando estas dos propiedades son iguales para diferentes kanji, se ordenan según su lectura.
Kanji de fuentes desconocidas
Se ha señalado que existen kanji en el conjunto de kanji que no se encuentran en diccionarios de kanji completos y sin abreviar, y que se desconocen sus fuentes. Por ejemplo, solo un año después de que se estableciera el primer estándar, Tajima (1979) informó que había confirmado 63 kanji que no se encontraban en Shinjigen (un gran diccionario de kanji publicado por Kadokawa Shoten ), ni en Dai Kan-Wa jiten , y que no tenían sentido como ryakuji de ningún tipo; señaló que sería preferible que los kanji no disponibles en los diccionarios de kanji se seleccionaran de fuentes definidas. Estos kanji llegaron a ser conocidos como caracteres "fantasma" (幽霊文字, yūrei moji ) o "kanji fantasma" (幽霊漢字, yūrei kanji ) , entre otros nombres.
El comité de redacción de la cuarta versión del estándar también consideró problemático el uso de kanji de origen desconocido, por lo que investigó qué tipo de fuentes había consultado el comité de redacción de la primera versión. Como resultado, se descubrió que el comité original se había basado en gran medida en los "Resultados del Análisis de Correspondencia" para recopilar los kanji. Al analizar dichos resultados, quedó claro que muchos de los kanji incluidos en el conjunto, pero no presentes en diccionarios exhaustivos, supuestamente provenían de las listas "Kanji para el Registro de Personalidades Japonesas" y "Kanji para la Lista de Distritos Administrativos Nacionales" mencionadas en los "Resultados del Análisis de Correspondencia".
Se confirmó que no existe ningún texto original para los caracteres kanji del registro de personalidades japonesas a los que se hace referencia en los "Resultados del análisis de correspondencia". Para la "Lista de distritos administrativos nacionales", Sasahara Hiroyuki, del comité de redacción de la cuarta versión, examinó los caracteres kanji que aparecían en las páginas de desarrollo del primer estándar. El comité también consultó numerosos escritos antiguos, así como muchos ejemplos de nombres propios en una base de datos de guías telefónicas de NTT .
Gracias a esta exhaustiva investigación, el comité pudo reducir a doce el número de kanji cuyo origen no se puede explicar con certeza, tal y como se muestra en la tabla adjunta. Se conjetura que varios de estos glifos surgieron debido a errores de copiado. En particular, 妛 probablemente se creó cuando los impresores intentaron crear 𡚴 cortando y pegando 山 y 女. Una sombra resultante de este proceso se interpretó erróneamente como una línea, dando como resultado 妛 (una imagen de esto se puede encontrar en el Jōyō kanji jiten ).
Unificación de variantes de kanji
Según las especificaciones del cuarto estándar (1997), la unificación (包摂, hōsetsu ; no es el mismo término que se usa para la " unificación " de Unicode , aunque el concepto es casi idéntico) consiste en asignar el mismo punto de código a un carácter sin importar sus diferentes formas. En el cuarto estándar, los glifos permitidos son limitados; el grado en que determinados glifos alográficos se unifican en un punto de código grafémico está claramente definido.
Además, según las especificaciones del estándar, un glifo (字体, jitai ; lit. "cuerpo del carácter";) es una noción abstracta sobre la representación gráfica de un carácter gráfico; una forma de carácter (字形, jikei ; lit. "forma del carácter"; también un "glifo" en cierto sentido, pero diferenciado en un nivel diferente para fines de estandarización) es la representación como una forma gráfica que un glifo toma en la realidad (por ejemplo, debido a que un glifo es escrito a mano, impreso, mostrado en una pantalla, etc.). Para un solo glifo, existe una gama infinita de posibles formas de caracteres concretamente y/o visiblemente diferentes. Una variación entre una forma de carácter de un glifo se denomina "diferencia de diseño" (デザインの差, dezain no sa ) .
El grado de unificación de un glifo a un punto de código se determina según el "glifo de ejemplo" (例示字体, reiji jitai ) de ese punto de código y los "criterios de unificación" (包摂規準, hōsetsu kijun ) que se pueden aplicar a ese glifo de ejemplo; es decir, el glifo de ejemplo para un punto de código se aplica a ese punto de código, y cualquier glifo cuyas partes que componen el glifo de ejemplo se reemplacen de acuerdo con los criterios de unificación también se aplica a ese punto de código.
Por ejemplo, el glifo de ejemplo en 33-46 (僧) está compuesto por el radical 9 (亻) y el kanji que eventualmente dio origen al so kana (曽). Además, en el criterio de unificación 101, se muestran tres kanji: el primero toma la forma más común en japonés (曽); el segundo contiene una forma más tradicional (曾) en la que los dos primeros trazos forman el radical 12 (el numeral kanji para el número 8:八); y el tercero es similar al segundo, excepto que el radical 12 está invertido (曾). En consecuencia, las tres permutaciones (僧,僧,僧) se aplican al punto de código en la celda 46 de la línea 33.
En la cuarta norma, que incluye una de las erratas de la primera edición, hay 186 criterios de unificación.
Cuando el glifo de ejemplo de un punto de código se compone de más de un glifo parcial, se pueden aplicar criterios de unificación a cada parte. Una vez aplicado un criterio de unificación a un glifo parcial, este no podrá recibir más criterios de unificación. Asimismo, no se permite aplicar un criterio de unificación si el glifo resultante coincide completamente con el de otro punto de código.
Un glifo de ejemplo no es más que un ejemplo para ese punto de código; no es un glifo "avalado" por el estándar. Además, los criterios de unificación solo deben usarse para los kanji de uso general y para asignar elementos a los puntos de código de este estándar. El estándar exige que no se creen kanji de uso general basados en los glifos de ejemplo y los criterios de unificación.
Los kanji del conjunto de kanji no se eligen de forma completamente consistente según los criterios de unificación. Por ejemplo, aunque 41-7 corresponde a la forma donde el tercer y cuarto trazo se cruzan (彥) así como a la forma donde no lo hacen (彦) según el criterio de unificación 72, 20-73 solo corresponde a la forma donde no se cruzan (顔), y 80-90 solo corresponde a la forma donde sí lo hacen (顏).
Los términos "unificación", "criterios de unificación" y "glifo de ejemplo" se adoptaron en la cuarta norma. Desde la primera hasta la tercera versión, los kanji y las relaciones entre ellos se agruparon en tres tipos: "independientes" (独立, dokuritsu ) , "compatibles" (対応, taiō ) y "equivalentes" (同値, dōchi ) ; se explicó que los caracteres reconocidos como equivalentes "se consolidan en un solo punto". La "equivalencia" incluía, además de los kanji con la misma forma, los kanji con diferencias debidas al estilo y los kanji donde la diferencia en la forma del carácter es pequeña.
En la primera norma, se estipuló que «esta norma... no establece los detalles de las formas de los caracteres» (Sección 3.1); también se indica que «el objetivo de esta norma es establecer la idea general de los caracteres y sus códigos; el diseño de sus formas y demás queda fuera de su alcance». En la segunda y tercera normas también se señala que los diseños específicos de las formas de los caracteres quedan fuera de su alcance (nota en el punto 1). La cuarta norma también estipula que «esta norma regula los caracteres gráficos, así como sus patrones de bits, y el uso, los diseños específicos de caracteres individuales, etc., no están dentro del alcance de esta norma» (JIS X 0208:1997, punto 1).
Criterios de unificación para la compatibilidad
En el cuarto estándar, se definen "criterios de unificación para mantener la compatibilidad con estándares anteriores" (過去の規格との互換性を維持するための包摂規準, kako no kikaku to no gokansei wo iji suru tame no hōsetsu kijun ) . Su aplicación se limita a 29 puntos de código cuyos glifos varían mucho entre los estándares JIS C 6226-1983 en adelante y JIS C 6226-1978. Para esos 29 puntos de código, los glifos de JIS C 6226-1983 en adelante se muestran como "A" y los glifos de JIS C 6226-1978 como "B". En cada uno de ellos se podrán aplicar tanto los glifos "A" como los "B". Sin embargo, para poder afirmar la compatibilidad con el estándar, debe indicarse explícitamente si se ha utilizado la forma "A" o "B" para cada punto de código.
Codificaciones de caracteres
Esquemas de codificación estipulados por JIS X 0208
En la norma JIS X 0208:1997, el artículo 7, junto con los apéndices 1 y 2, define un total de ocho esquemas de codificación.
En las descripciones siguientes, las regiones "CL" (control izquierdo), "GL" (gráfico izquierdo), "CR" (control derecho) y "GR" (gráfico derecho) corresponden, respectivamente, en notación de columna/línea, de 0/0 a 1/15, de 2/1 a 7/14, de 8/0 a 9/15 y de 10/1 a 15/14. Para cada código, a 2/0 se le asigna el carácter gráfico "ESPACIO" y a 7/15 el carácter de control "SUPR". Los caracteres de control C0 (definidos en JIS X 0211 y que coinciden con ISO/IEC 6429 ) se asignan a la región CL.
- Codificación de 7 bits para kanji
- Estipulado en el propio estándar. El conjunto de doble byte JIS X 0208 se asigna a la región GL.
- Codificación de 8 bits para kanji
- Estipulado en el propio estándar. Igual que la codificación de 7 bits, pero definida en términos de bytes de 8 bits. La región CR puede no utilizarse o codificar los caracteres de control C1 de JIS X 0211. La región GR no se utiliza.
- Versión de referencia internacional + codificación de 7 bits para kanji
- Estipulado en la propia norma. El desplazamiento hacia adentro del carácter de control designa la versión de referencia internacional (IRV, equivalente a US-ASCII ) de ISO/IEC 646 :1991 a la región GL. El desplazamiento hacia afuera designa el conjunto de doble byte JIS X 0208 a la misma región.
- Caracteres latinos + codificación de 7 bits para kanji
- Estipulado en el propio estándar. Igual que con IRV+7-bit, pero con ISO/IEC 646:IRV reemplazado por ISO/IEC 646:JP (el conjunto romano de JIS X 0201 ).
- Versión de referencia internacional + codificación de 8 bits para kanji
- Estipulado en la propia norma. ISO/IEC 646:IRV se asigna a la región GL, JIS X 0208 a la región GR. Esto es, en efecto, un subconjunto de EUC-JP , excluyendo los katakana de ancho reducido de JIS X 0201 y los kanji suplementarios de JIS X 0212 .
- Caracteres latinos + codificación de 8 bits para kanji
- Estipulado en el propio estándar. Igual que IRV+8-bit, pero con ISO/IEC 646:IRV reemplazado por ISO/IEC 646:JP.
- Conjunto de caracteres codificados con Mayúsculas
- Estipulado en el Apéndice 1: "Representación codificada por turnos" (シフト符号化表現, Shifuto Fugōka Hyōgen ) . La definición autorizada de Shift JIS .
- Conjunto de caracteres codificados según RFC 1468
- Estipulado en el Apéndice 2: " RFC 1468 - Representación codificada" ( RFC 1468符号化表現, RFC 1468 Fugōka Hyōgen ) . Se asemeja a ISO-2022-JP (que se define de forma autorizada en RFC 1468 ), pero se define en términos de bytes de ocho bits, mientras que ISO-2022-JP se define en términos de bytes de siete bits.
Entre las codificaciones estipuladas en el cuarto estándar, solo el conjunto de caracteres codificados "Shift" está registrado por la IANA . [ 11 ] Sin embargo, otras están estrechamente relacionadas con codificaciones registradas por la IANA definidas en otros lugares (EUC-JP e ISO-2022-JP).
Secuencias de escape para JIS X 0202 / ISO 2022
JIS X 0208 puede utilizarse dentro de ISO 2022 /JIS X 0202 (de la cual ISO-2022-JP es un subconjunto). Las secuencias de escape para asignar JIS X 0208 a cada uno de los cuatro conjuntos de códigos ISO 2022 se enumeran a continuación. Aquí, "ESC" se refiere al carácter de control " Escape " (0x1B o 1/11).
La secuencia de escape que comienza con ESC 2/4 selecciona un conjunto de caracteres multibyte. La secuencia de escape que comienza con ESC 2/6 especifica una revisión de la selección del conjunto de caracteres siguiente. JIS C 6226:1978 se identifica mediante el identificador de conjunto multibyte-94 byte 4/0 (correspondiente a ASCII @). JIS C 6226:1983 / JIS X 0208:1983 se identifica mediante el identificador de conjunto multibyte-94 byte 4/2 ( B). JIS X 0208:1990 también se identifica mediante el identificador de conjunto 94 byte 4/2, pero se puede distinguir con el identificador de revisión 4/0 ( @).
Codificaciones duplicadas de ASCII y JIS X 0201
Al utilizar el conjunto de caracteres kanji de este estándar con el conjunto de caracteres gráficos IRV ( ASCII ) de la norma ISO/IEC 646:1991 o con el conjunto de caracteres gráficos para caracteres latinos ( JIS-Romano ) de la norma JIS X 0201, el tratamiento de los caracteres comunes a ambos conjuntos se vuelve problemático. A menos que se tomen medidas especiales, los caracteres incluidos en ambos conjuntos no se corresponden entre sí de forma unívoca, y un mismo carácter puede tener más de un punto de código; es decir, puede provocar una codificación duplicada.
La norma JIS X 0208:1997, en lo que respecta a cuándo un carácter es común a ambos conjuntos, prohíbe básicamente el uso del punto de código en el conjunto de kanji (que es uno de los dos puntos de código), eliminando así las codificaciones duplicadas. Se considera que los caracteres que tienen el mismo nombre son el mismo carácter.
Por ejemplo, tanto el nombre del carácter correspondiente al patrón de bits 4/1 en ASCII como el nombre del carácter correspondiente a la fila 3, celda 33 del conjunto de caracteres kanji son "LETRA MAYÚSCULA LATINA A". En la versión de referencia internacional + código de 8 bits para kanji, ya sea mediante el patrón de bits 4/1 o mediante el patrón de bits correspondiente a la fila 3, celda 33 del conjunto de caracteres kanji (10/3 12/1), se representa la letra " A " (es decir, "LETRA MAYÚSCULA LATINA A"). El estándar prohíbe el uso del patrón de bits "10/3 12/1", en un intento por eliminar la codificación duplicada.
En consideración a las implementaciones que tratan los caracteres de los puntos de código en el conjunto kanji como " caracteres de ancho completo " y los de ASCII o JIS-Roman como caracteres diferentes, el uso de los puntos de código del conjunto kanji solo se permite por razones de retrocompatibilidad. Por ejemplo, para fines de retrocompatibilidad, se permite considerar 10/3 12/1 en la Versión de Referencia Internacional + código de 8 bits para kanji como correspondiente a una "A" de ancho completo.
Si se utiliza el conjunto de caracteres kanji junto con ASCII o JIS-Roman, incluso si se sigue estrictamente el estándar, no se garantiza la codificación única de un carácter. Por ejemplo, en la Versión de Referencia Internacional + código de 8 bits para kanji, es válido representar un guion con el patrón de bits 2/13 para el carácter "GUIÓN-MENOS", así como con la fila 1, celda 30 del conjunto de caracteres kanji (patrón de bits 10/1 11/14) para el carácter "GUIÓN". Además, el estándar no define cuál de los dos usar para cada caso, por lo que el guion no tiene una codificación única. El mismo problema afecta al signo menos , las comillas , etc.
Además, incluso si el conjunto de caracteres kanji se utiliza como un código independiente, no hay garantía de que se implemente la codificación única de los caracteres. Sin embargo, en muchos casos, coexisten el " ESPACIO IDEOGRÁFICO " de ancho completo en la fila 1, celda 1, y el espacio de medio ancho (2/0). La diferencia entre ambos no es evidente y no está especificada en el estándar.
Comparación de los esquemas de codificación utilizados en la práctica
- ↑ Es decir, no requiere transmisión limpia de 8 bits .
- ↑ Es decir, la secuencia utilizada para codificar un carácter dado es siempre la misma, independientemente de cuáles fueran los caracteres anteriores. Véase estado (ciencia de la computación) .
- 1 2 ISO-2022-JP es una codificación con estado : todos los conjuntos de caracteres se codifican sobre 0x21 – 7E y se alternan mediante secuencias de escape ANSI. Por lo tanto, aunque inicialmente es ASCII, se pueden codificar secuencias completas de caracteres no ASCII con bytes ASCII.
- ↑ Los caracteres katakana de JIS X 0201 están disponibles en JIS X 0202 e ISO 2022, pero no están incluidos en el perfil básico ISO-2022-JP, aunque son una extensión común.
- ↑ JIS X 0212 está disponible en JIS X 0202 e ISO 2022, y se incluye en los perfiles ISO-2022-JP-1 e ISO-2022-JP-2, pero no en el perfil básico ISO-2022-JP.
- ↑ Los caracteres de un solo byte 0x21 – 7E en Shift_JIS son propiamente ISO-646-JP , para ser un superconjunto de JIS X 0201 de 8 bits, pero a menudo se decodifican (no necesariamente se muestran) como ASCII, que difiere solo en dos lugares.
- ↑ Algunos bytes ASCII (no todos) pueden aparecer como segundos bytes, pero no como primeros, de caracteres de doble byte en Shift_JIS. Por lo tanto, en una secuencia de dos o más bytes ASCII, el segundo byte en adelante son necesariamente caracteres ASCII (o ISO-646-JP).
- 1 2 El EUC en formato empaquetado se basa en los mecanismos de la norma ISO 2022, con designaciones de conjuntos de caracteres predefinidas. Se evitan los escapes de designación de conjuntos de caracteres y los cambios de bloqueo, mientras que el uso de cambios simples puede implementarse de forma no conmutada. No obstante, se respetan las restricciones de la norma ISO 2022.
- ↑ Los caracteres de un solo byte 0x21 – 7E en EUC-JP generalmente se consideran ASCII, pero a veces se tratan como ISO-646-JP .
- ↑ A diferencia de Shift_JIS, EUC-JP no procesará la entrada JIS X 0201 simple de 8 bits sin conversión previa, debido a la diferente representación del katakana JIS X 0201 (con desplazamientos simples).
- ↑ La norma JIS X 0212 en EUC-JP no siempre está implementada.
- Además de las propiedades de las propias codificaciones, los formatos Unicode ofrecen otras ventajas derivadas del conjunto de caracteres subyacente: no se limitan a los caracteres codificados en JIS, sino que pueden representar la totalidad del UCS (incluido el repertorio completo de caracteres codificados en JIS), lo que los hace idóneos para el uso internacional. Asimismo, se ven menos afectados por las colisiones con extensiones propietarias, gracias a su mayor repertorio base y a las áreas de uso privado designadas.
- ↑ La mayoría de los desplazamientos de marco bit a bit de texto codificado en UTF-8 producirán UTF-8 no válido, pero es posible construir secuencias de caracteres que sigan siendo UTF-8 válidos incluso cuando se desplacen uno o más bits.
- ↑ Solo por Microsoft.
- ↑ Si bien GB 18030 y GBK son extensiones del formato EUC-CN de GB/T 2312, no siguen las restricciones de EUC o ISO 2022, a diferencia de EUC-JP (o la EUC-CN original).
- ↑ Aunque, en teoría, UTF-32 se autosincroniza solo con dwords de 32 bits, el uso de un valor de 32 bits para representar un valor de 21 bits significa que, en la práctica, UTF-32 contiene una secuencia continua de al menos 11 bits cero en el extremo superior de cada carácter, que normalmente se puede utilizar para alinear con los límites de los caracteres, dependiendo del o los puntos de código involucrados.
Historia
Hasta que transcurran cinco años desde que una norma industrial japonesa se haya establecido, reafirmado o revisado, la norma anterior se somete a un proceso de reafirmación, revisión o retirada. Desde su establecimiento, la norma ha sido revisada tres veces y, actualmente, la cuarta versión está vigente.
Primer estándar
El primer estándar es JIS C 6226-1978 "Código del conjunto de caracteres gráficos japoneses para el intercambio de información" (情報交換用漢字符号系, Jōhō Kōkan'yō Kanji Fugōkei ) , establecido por el Ministro de Comercio Internacional e Industria de Japón el 1 de enero de 1978. También se le conoce como 78JIS . Por encargo de la Agencia de Ciencia y Tecnología Industrial , un comité de investigación y estudio de estandarización de códigos kanji de JIPDEC elaboró el borrador. El presidente del comité fue Moriguchi Shigeichi .
El código incluía 453 caracteres no Kanji (incluidos Hiragana, Katakana, los alfabetos romano, griego y cirílico, y signos de puntuación) y 6349 Kanji (2965 Kanji de nivel 1 y 3384 Kanji de nivel 2) para un total de 6802 caracteres. [ 12 ] Todavía no incluía caracteres de dibujo de recuadros . El estándar en sí se estableció en la tipografía Ishii Mincho de Shaken Co., Ltd.
Segundo estándar
La segunda norma JIS C 6226-1983 "Código del conjunto de caracteres gráficos japoneses para el intercambio de información" (情報交換用漢字符号系, Jōhō Kōkan'yō Kanji Fugōkei ) revisó la primera norma el 1 de septiembre de 1983. También se la conoce como 83JIS . Por encargo de la AIST, un comité JIS relacionado con el código kanji de JIPDEC elaboró el borrador. El presidente del comité fue Motooka Tōru .
El borrador de la segunda norma se basó en la consideración de factores como la promulgación de los caracteres jōyō kanji , la aplicación de los caracteres jinmeiyō kanji y la estandarización del Teletex en idioma japonés por parte del Ministerio de Correos y Telecomunicaciones ; además, la siguiente modificación se realizó para estar al día con la norma JIS C 6234-1983 (formatos de caracteres para impresoras matriciales de 24 píxeles; actualmente JIS X 9052).
- Adición de caracteres especiales
- Se añadieron 39 caracteres a los caracteres especiales. De entre estos 39, según las recomendaciones de JICST y de normas como JIS Z 8201-1981 (símbolos matemáticos) y JIS Z 8202-1982 (cantidad, unidad y símbolos químicos), se eligieron elementos que no podían representarse mediante composición.
- Nuevos personajes para dibujar cajas
- Se añadieron 32 personajes con dibujos de recuadros .
- Intercambio de puntos de código itaiji
- Los puntos de código para 22 pares de variantes de Kanji se intercambiaron, de modo que la variante en el nivel 2 se movió al nivel 1 y viceversa. [ 12 ] [ 13 ] Por ejemplo, la fila 36 celda 59 (del nivel 1) en el primer estándar (壺) se movió a la fila 52 celda 68 (del nivel 2); el punto originalmente en la fila 52 celda 68 (壷) se movió a su vez a la fila 36 celda 59.
- Adiciones a los kanji de nivel 2
- Tres caracteres del nivel 1 y un carácter del nivel 2 recibieron nuevos puntos de código en puntos de código previamente no asignados en la fila 84 como kanji de nivel 2. Los Itaiji para cada uno de esos puntos de código se reasignaron a sus ubicaciones originales. [ 14 ] Por ejemplo, la celda 1 de la fila 84 en el segundo estándar (堯) se movió allí para acomodar una forma diferente no incluida en el primer estándar en la celda 38 de la fila 22 como un kanji de nivel 1 (尭).
- Modificación de las formas de los caracteres
- Se modificaron las formas de los caracteres de aproximadamente 300 kanji. [ 15 ]
Entre los cambios en esas aproximadamente 300 formas de caracteres kanji, muchos glifos de nivel 1 que estaban en el estilo del Diccionario Kangxi se cambiaron a variantes, y especialmente a formas más simplificadas (por ejemplo, ryakuji y shinjitai extendido ). Por ejemplo, un par de puntos de código que suelen ser objeto de críticas debido a que fueron modificados significativamente son la fila 18, celda 10 (78JIS:鷗, 83JIS:鴎) y la fila 38, celda 34 (78JIS:瀆, 83JIS:涜).
Hubo muchos cambios menores que se alejaron de las variantes de estilo Kangxi; por ejemplo, la fila 25, celda 84 (鵠) perdió parte de un trazo. Además, donde algunos glifos para kanji de nivel 1 no eran formas de estilo Kangxi, algunos se cambiaron a sus formas de estilo Kangxi; por ejemplo, la fila 80, celda 49 (靠) ganó parte de un trazo (es decir, la misma parte del trazo que perdió la 25-84).
Para dilucidar la intención original de la primera norma, estas terminaron encajando en los parámetros de los criterios de unificación de la cuarta norma. La diferencia de forma de los ejemplos mencionados anteriormente ("鵠" y "靠") se incluye en los parámetros del criterio de unificación 42 (relativo al componente "告"). [ t ]
La mayoría de los cambios en las formas de los caracteres son diferencias entre los kanji de nivel 1 y nivel 2. Específicamente, la simplificación se realizó con más frecuencia para los kanji de nivel 1 que para los de nivel 2; las simplificaciones aplicadas a los kanji de nivel 1 (por ejemplo, "潑" a "溌" y "醱" a "醗") generalmente no se aplicaron a los kanji de nivel 2 ("撥" se mantuvo igual). Los mencionados 25-84 (鵠) y 80-49 (靠) recibieron un tratamiento diferente de igual manera, ya que el primero está en el nivel 1 y el segundo en el nivel 2. Aun así, hubo algunos cambios independientemente del nivel; por ejemplo, los caracteres que contienen los componentes "puerta" (戸) e "invierno" (冬) se modificaron sin diferencia de tratamiento entre los kanji de nivel 1 y nivel 2.
Sin embargo, en 29 puntos del código (como los problemáticos 18-10 y 38-34 mencionados anteriormente), las formas heredadas por el cuarto estándar contradicen la intención original del primero. Para estos, existen criterios de unificación especiales que permiten mantener la compatibilidad con los estándares anteriores en dichos puntos del código.
Cuando se introdujo la nueva categoría "X" para las Normas Industriales Japonesas (para campos relacionados con la información), la segunda norma pasó a denominarse JIS X 0208-1983 [ 12 ] el 1 de marzo de 1987.
Tercer estándar
La tercera norma JIS X 0208-1990 "Código de conjunto de caracteres gráficos japoneses para el intercambio de información" (情報交換用漢字符号, Jōhō Kōkan'yō Kanji Fugō ) revisó la segunda norma el 1 de septiembre de 1990. También se la conoce como 90JIS . Por encargo de la AIST, un comité de la Asociación Japonesa de Normas elaboró el borrador para la revisión de la JIS X 0208. El presidente del comité fue Tajima Kazuo .
Se cambiaron 225 glifos kanji y se agregaron dos caracteres al nivel 2 (84-05 "凜" y 84-06 "熙"). Esto fue una desunificación de itaiji para dos caracteres que ya estaban incluidos (49-59 "凛" y 63-70 "煕"). Algunos de los cambios y las dos adiciones correspondieron a los 118 kanji jinmeiyō agregados en marzo de 1990. [ 12 ] El estándar en sí se estableció en Heisei Mincho .
Cuarto estándar
El cuarto estándar JIS X 0208:1997 "Conjuntos KANJI codificados de doble byte de 7 y 8 bits para el intercambio de información" ( 7ビット及び8ビットの2バイト情報交換用符号化漢字集合, Nana-Bitto Oyobi Hachi-Bitto no Ni-Baito Jōhō Kōkan'yō Fugōka Kanji Shūgō ) revisó el tercer estándar el 20 de enero de 1997. También se llama 97JIS para abreviar. Por encargo de la AIST, un comité de la JSA para la investigación y el estudio de conjuntos de caracteres codificados produjo el borrador. El presidente del comité era Shibano Kōji .
Los principios básicos de esta revisión consistieron en no modificar el conjunto de caracteres, aclarar las disposiciones ambiguas y facilitar el uso del estándar. No se añadieron, eliminaron ni reorganizaron los puntos de código, y, sin excepción, los glifos de ejemplo también se mantuvieron sin cambios. Sin embargo, las estipulaciones del estándar se reescribieron o complementaron por completo. Mientras que el tercer estándar constaba de 65 páginas sin las explicaciones, el cuarto estándar constaba de 374 páginas sin las explicaciones.
Los puntos principales de la revisión son:
- Definición de métodos de codificación
- Hasta la tercera norma, solo se definía el método de codificación basado en la extensión de código JIS X 0202. Esto resulta inusual en lo que respecta a conjuntos de caracteres codificados. En la cuarta norma, se definieron métodos de codificación que no utilizan secuencias de escape para la extensión de código.
- Definición de la prohibición general del uso de puntos de código no asignados y métodos de uso para puntos de código no asignados
- La tercera norma, en una explicación que no formaba parte de la norma, describía la situación como si existieran casos en los que, para algunos puntos de código no asignados, fuera aceptable asignar gaiji. En la cuarta norma, se aclaró que el uso de puntos de código no asignados está generalmente prohibido. Asimismo, se especificaron las condiciones para el uso de dichos puntos.
- Eliminación general de codificaciones duplicadas
- A cada carácter se le asignó un "nombre de carácter" que se corresponde con los de otros estándares. Asimismo, se especificaron métodos de codificación para su uso junto con la Versión de Referencia Internacional de la ISO/IEC 646 o la JIS X 0201. Cuando se utiliza la JIS X 0208 junto con cualquiera de ellas, de entre dos puntos de código asignados a caracteres con el mismo nombre, solo se permite uno; por lo tanto, se eliminaron las codificaciones duplicadas.
- Investigación sobre las fuentes de los kanji
- Se identificaron los caracteres incluidos en el estándar hasta el momento que no se encuentran ni en el Diccionario Kangxi ni en el Dai Kanwa Jiten . En consecuencia, se investigó el propósito exacto de su inclusión y las fuentes de donde procedían estos kanji durante la compilación del primer estándar.
- Definición de los criterios de unificación de kanji
- A partir de elementos como los materiales utilizados para la elaboración del primer estándar, se intentó recuperar la intención original del estándar en cuanto al alcance de los glifos que representa cada punto de código. Además, se definieron claramente los criterios para unificar los glifos kanji.
- Inclusión de normas de facto
- Para cuando se publicó el cuarto estándar, los métodos de codificación Shift JIS e ISO-2022-JP se habían convertido en estándares de facto para la informática personal y el correo electrónico, respectivamente. Estos métodos de codificación se incluyeron como "Representación codificada Shift" y " Representación codificada RFC 1468 " (descritas anteriormente).
Sucesores
JIS X 0213 ( kanji extendido ) fue diseñado "con el objetivo de ofrecer un conjunto de caracteres suficiente para los propósitos de codificar el idioma japonés moderno que JIS X 0208 pretendía ser desde el principio"; [ 16 ] define un conjunto de caracteres que amplía el conjunto de kanji de JIS X 0208. Los redactores de JIS X 0213 recomiendan la migración de JIS X 0208 a JIS X 0213, entre las ventajas se encuentra la compatibilidad de JIS X 0213 con la Lista de Glifos Kanji Hyōgai y con los kanji jinmeiyō más recientes .
Contrariamente a las expectativas de sus redactores, la adopción de la norma JIS X 0213 ha sido todo menos rápida desde su promulgación en el año 2000. El comité de redacción de la norma JIS X 0213:2004 escribió (en el año 2004): «La situación en la que "la mayoría de los sistemas de información solo pueden usar la norma JIS X 0208" sigue vigente». (JIS X 0213:2000, Apéndice 1:2004, sección 2.9.7)
En Microsoft Windows , el sistema operativo predominante (y, por lo tanto, el que proporciona el entorno de escritorio predominante ) en el sector de la informática personal, el repertorio JIS X 0213 se incluyó desde Windows Vista , lanzado en noviembre de 2006. Mac OS X es compatible con JIS X 0213 desde la versión 10.1 (lanzada en 2001). Muchos sistemas tipo Unix, como Linux , pueden admitir JIS X 0213 (opcionalmente) si se desea. Por lo tanto, se cree que, con el tiempo, la compatibilidad con JIS X 0213 en ordenadores personales no será un impedimento para su eventual adopción.
Entre los redactores de la norma JIS X 0213, hay quienes prevén una combinación de JIS X 0208 y JIS X 0213 antes de la adopción de esta última (Satō, 2004). Sin embargo, JIS X 0208 se sigue utilizando actualmente y muchos predicen que perdurará como norma. Existen obstáculos que deben superarse para que JIS X 0213 reemplace a JIS X 0208 en el uso común:
- Los repertorios de caracteres utilizados actualmente en los teléfonos móviles japoneses se basan en JIS X 0208. No existen planes oficiales para migrarlos a la compatibilidad con JIS X 0213. Dado que los teléfonos móviles son ahora un elemento fundamental de la comunicación textual japonesa (véase la cultura de los teléfonos móviles en Japón ), al ser un medio ampliamente utilizado para enviar correos electrónicos y acceder a la World Wide Web , su escasa adopción limita su uso en otros lugares.
- La norma JIS X 0213 no es estrictamente compatible con JIS X 0208 en cuanto a criterios de unificación (véase más abajo ). Para archivos de gran tamaño (por ejemplo, bases de datos bibliográficas y Aozora Bunko ) que utilizan JIS X 0208 y siguen estrictamente sus criterios de unificación, se considera que sería extremadamente difícil convertir todos los datos a JIS X 0213 y, al mismo tiempo, mantener el mismo nivel de integridad textual.
- En la práctica, muchos sistemas definen y utilizan puntos de código no asignados en JIS X 0208. Por ejemplo, Windows asigna caracteres extendidos de IBM y NEC, así como áreas de caracteres definidas por el usuario (véase Windows-932 ), y los teléfonos móviles asignan emojis en algunos de estos lugares. Los puntos de código de estos caracteres entran en conflicto con los puntos de código que utiliza JIS X 0213, por lo que migrar estos sistemas de JIS X 0208 a JIS X 0213 presentaría dificultades. También existen planes para migrar a UCS / Unicode y utilizar el repertorio de JIS X 0213, pero hasta que un administrador de sistemas pueda determinar que las implementaciones de pares sustitutos y composiciones de caracteres de UCS/Unicode son suficientemente estables, es probable que dude en utilizar el repertorio de JIS X 0213 que requiere dichas implementaciones.
- Las mejoras que aporta la norma JIS X 0213 se centran principalmente en caracteres que no se utilizan con tanta frecuencia como los que ya están presentes en la norma JIS X 0208. Dado que hay casi el doble de glifos que implementar para reducir el uso de esos glifos adicionales, en muchos casos la inversión puede resultar poco rentable, sobre todo cuando los recursos son limitados.
Implementaciones
Dado que JIS X 0208 / JIS C 6226 es principalmente un conjunto de caracteres y no una codificación de caracteres estrictamente definida , varias empresas han implementado sus propias codificaciones de dicho conjunto de caracteres.
- Apple : MacJapanese (basado en Shift_JIS)
- Fujitsu : Código kanji JEF (basado en EBCDIC)
- Hitachi : KEIS (basado en EBCDIC)
- IBM : varios, incluidos IBM-932 e IBM-942 (ambos basados en Shift_JIS).
- Microsoft : Windows-932 (basado en Shift JIS)
- NEC : JIPS
Varias de estas incorporan asignaciones de caracteres específicas del proveedor en lugar de las regiones no asignadas del estándar. Entre ellas se incluyen Windows-932 y MacJapanese, así como la codificación de caracteres PC98 de NEC . Si bien IBM-932 e IBM-942 también incluyen asignaciones del proveedor, las ubican fuera de la región utilizada para JIS X 0208.
Relación con otras normas
ISO/IEC 646 IRV y ASCII
Como se indicó anteriormente, el conjunto de caracteres kanji no es compatible con versiones anteriores del conjunto de caracteres gráficos IRV (ASCII) ISO/IEC 646:1991. Ambos conjuntos de caracteres pueden utilizarse conjuntamente, tal como se especifica en JIS X 0208 (IRV + código de 7 bits para kanji e IRV + código de 8 bits para kanji). También pueden utilizarse conjuntamente en EUC-JP .
JIS X 0201
El conjunto de caracteres kanji carece de tres caracteres incluidos en el conjunto de caracteres gráficos de JIS X 0201 para caracteres latinos: 2/2 (comillas), 2/7 (apóstrofe) y 2/13 (guion). El conjunto de caracteres kanji contiene todos los caracteres incluidos en el conjunto de caracteres gráficos de JIS X 0201 para katakana.
El conjunto de caracteres kanji y el conjunto de caracteres gráficos para caracteres latinos se pueden usar juntos como se especifica en JIS X 0208 (caracteres latinos + código de 7 bits para kanji y caracteres latinos + código de 8 bits para kanji). El conjunto de caracteres kanji, el conjunto de caracteres gráficos para caracteres latinos y el conjunto de caracteres gráficos de JIS X 0201 para katakana se pueden usar juntos como se especifica en JIS X 0208 (el conjunto de caracteres codificados por desplazamiento; es decir, Shift JIS ). El conjunto de caracteres kanji y el conjunto de caracteres gráficos para katakana se pueden usar juntos en EUC-JP .
JIS X 0212
JIS X 0212 (kanji suplementario) define caracteres adicionales con puntos de código para el procesamiento de información que requiere caracteres no presentes en JIS X 0208. En lugar de asignar caracteres dentro del conjunto principal de kanji JIS X 0208, define un segundo conjunto de kanji de 94x94 que contiene caracteres suplementarios.
JIS X 0212 se puede usar con JIS X 0208 en EUC-JP . Además, tanto JIS X 0208 como JIS X 0212 son estándares fuente para la unificación Han de UCS/Unicode , lo que significa que los caracteres kanji de ambos conjuntos se pueden incluir en un mismo documento en formato Unicode.
Entre los puntos de código que la segunda versión de JIS X 0208 modificó, 28 puntos de código en JIS X 0212 reflejan las formas de caracteres anteriores a los cambios. [ 17 ] Además, JIS X 0212 reasigna la " marca de cierre " que JIS X 0208 había asignado como un no-kanji ( 〆 , en la fila 1, celda 26) como un kanji (乄, en la fila 16, celda 17). JIS X 0212 no tiene caracteres en común con JIS X 0208 aparte de estos. Por lo tanto, no es adecuado para uso general por sí solo.
Sin embargo, en la cuarta versión de JIS X 0208, la conexión con JIS X 0212 no se definió en absoluto. Se cree que esto se debe a que el comité de redacción de la cuarta versión de la norma JIS X 0208 tenía una opinión crítica sobre los métodos de selección e identificación de JIS X 0212. [ 18 ] Los significados de los caracteres y los fundamentos de la selección no estaban debidamente documentados, lo que dificultaba determinar si los kanji deseados correspondían a los de su repertorio. [ 19 ] El texto de la cuarta versión de la norma, además de señalar los puntos problemáticos de la selección de caracteres de JIS X 0212, afirma que «se considera que no solo es imposible la selección de caracteres, sino también su uso conjunto; la conexión con JIS X 0212 no está definida en absoluto». (sección 3.3.1)
JIS X 0213

JIS X 0213 (kanji de extensión) define un conjunto de kanji que amplía el conjunto de kanji de JIS X 0208. Según esta norma, está "diseñada con el objetivo de ofrecer un conjunto de caracteres suficiente para la codificación del idioma japonés moderno, tal como JIS X 0208 pretendía ser desde el principio". [ 16 ]
El conjunto de kanji de JIS X 0213 incorpora todos los caracteres que pueden representarse en el conjunto de kanji de JIS X 0208, con muchas adiciones. En total, JIS X 0213 define 1183 caracteres no kanji y 10 050 kanji (para un total de 11 233 caracteres), dentro de dos planos de 94 por 94 (面, men ) . El primer plano (caracteres no kanji y kanji de nivel 1 a 3) se basa en JIS X 0208, mientras que el segundo plano (kanji de nivel 4) está diseñado para ajustarse a las filas no asignadas de JIS X 0212, lo que permite su uso en EUC-JP . [ 20 ] JIS X 0213 también define Shift_JISx0213 , una variante de Shift_JIS capaz de codificar la totalidad de JIS X 0213.
En la práctica, el plano 1 de JIS X 0213 es un superconjunto de JIS X 0208. Sin embargo, se aplican criterios de unificación diferentes a algunos puntos de código en JIS X 0213 en comparación con JIS X 0208. En consecuencia, algunos pares de glifos kanji que estaban representados por un solo punto de código en JIS X 0208, debido a su unificación, reciben puntos de código separados en JIS X 0213. Por ejemplo, el glifo en la fila 33, celda 46 de JIS X 0208 ("僧", descrito anteriormente ) unifica algunas variantes debido a su componente derecha. En JIS X 0213, dos formas (las que contienen el componente "丷") se unifican en el plano 1, fila 33, celda 46, y la otra (que contiene el componente "八") se encuentra en el plano 1, fila 14, celda 41. Por lo tanto, no se puede determinar automáticamente si la celda 46 de la fila 33 de JIS X 0208 debe asignarse al plano 1, fila 33, celda 46 o al plano 1, fila 14, celda 41 de JIS X 0213. [ u ] Esto limita el grado en que JIS X 0213 puede considerarse compatible con JIS X 0208, como lo admitió el comité de redacción de JIS X 0213. [ 21 ]
Sin embargo, en general, la fila m, celda n en JIS X 0208 se corresponde con el plano 1, fila m, celda n en JIS X 0213; por lo tanto, en la práctica no suele haber mucha confusión. Esto se debe a que la mayoría de las tipografías utilizan los glifos ejemplificados en JIS X 0208, y la mayoría de los usuarios no son conscientes de los criterios de unificación.
ISO/IEC 10646 y Unicode
El conjunto de caracteres kanji de JIS X 0208 se encuentra entre los estándares originales para la unificación del idioma Han en ISO/IEC 10646 (UCS) y Unicode . Cada kanji en JIS X 0208 corresponde a su propio punto de código en el Plano Multilingüe Básico (BMP) de UCS/Unicode .
Los caracteres no kanji en JIS X 0208 también se corresponden con sus propios puntos de código en el BMP. Sin embargo, para algunos caracteres especiales, algunos sistemas implementan correspondencias diferentes a las de UCS/Unicode (que se basan en los nombres de caracteres dados en JIS X 0208:1997).
Notas a pie de página
Explicativo
- ↑ Faltan diacríticos griegos y sigma final .
- 1 2 3 4 ( Retirado )
- ↑ JIS y Apple: U+2014.Unicode, [ b ] Microsoft y WHATWG: U+2015.
- ↑ Microsoft y WHATWG: U+FF5E.Unicode, [ b ] JIS y Apple: U+301C.
- ↑ Microsoft y WHATWG: U+2225.Unicode, [ b ] JIS y Apple: U+2016.
- ↑ Microsoft: U+FF0D.Unicode, [ b ] JIS y Apple: U+2212.WHATWG: U+FF0D en la decodificación, excepcionalmente ambos en la codificación.
- 1 2 3 4 Añadido en JIS X 0213
- ↑ Ausente en la versión original de la extensión, que es anterior a la era Heisei . Posición del código seleccionada por NEC o Microsoft. [ 5 ] No está en Macintosh PostScript.
- 1 2 3 4 5 6 7 8 9 Duplicado por adiciones realizadas a la fila 2 en 1983. No codificado aquí (pero dejado sin asignar) en JIS X 0213, [ 5 ] pero codificado duplicado aquí por Microsoft y WHATWG. En cuanto a la codificación PostScript de Macintosh, se agrega un Uso privado U+F87F al formulario decodificado con las funciones de la biblioteca de macOS para permitir el viaje de ida y vuelta.
- ↑ Como se muestra en las tablas de códigos registradas en el Registro Internacional de Conjuntos de Caracteres Codificados para Ser Usados con Secuencias de Escape, antes del cuarto estándar (1997), ku (区) y ten (点) se llamaban respectivamente "section" y "position" en inglés. En cuanto al trasfondo del cambio en inglés, en el estándar JIS X 0221-1995 (UCS) que tradujo ISO/IEC 10646-1:1993, "group", "plane", "row" y "cell" se pueden traducir como gun (群) , men (面) , ku (区) y ten (点) . Sin embargo, row y cell de JIS X 0208 y row y cell de UCS son conceptos diferentes.
- ↑ Los nombres de los caracteres se escriben con letras romanas y se utilizan internacionalmente, por lo que pueden considerarse una convención internacional, similar a los nombres científicos de los organismos vivos. En este sentido, los nombres comunes japoneses para los caracteres serían como usar nombres comunes para los organismos.
- ↑ Para una búsqueda o clasificación completa según el orden de los caracteres kana, se deben tener en cuenta las lecturas de las palabras, las marcas de repetición, etc. La clasificación de las cadenas de caracteres japoneses se describe en la norma JIS X 4061 (Cotejo de cadenas de caracteres japoneses).
- ↑ Según Yasuoka (2001a), parece que hubo algunos descuidos accidentales. Señala, por ejemplo, que el ba (旛; 58-57) de Inba y el shi (泗; 61-89) de Shisui, Kumamoto no forman parte del nivel 1.
- ↑ Lista:丼ceived ceived
- ↑ El kanji jōyō 𠮟󠄀 se incluye únicamente en su forma variante oficial 叱.
- ↑ Lista:乘ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived ceived
- ↑ Lista:焰ceived禱aunt薰ڠ諸ڠ賴♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥♥海ceived視ceived層ceived晚ceived淚ceived
- ↑ Para las celdas 30 y 31 de la fila 19, el orden de sus lecturas representativas está alterado. En consecuencia, donde el orden correcto debería ser kaeru (蛙, "rana") seguido de kaori (馨, "aroma") , sus posiciones están transpuestas de modo que kaori precede a kaeru .
- ↑ Además, la variante utilizada principalmente (剣) se encuentra en la fila 23, celda 85, en el nivel 1, y otra variante (釼) se puede encontrar agrupada como poseedora del radical "oro" en la fila 78, celda 63, en el nivel 2.
- ↑ La decisión sobre qué glifos, dentro de los criterios de unificación, deben utilizarse queda a criterio del diseñador tipográfico. En función de ello (y de las circunstancias del usuario final), es posible que ninguno, ambos, uno u otro de estos dos sigan la forma del estilo Kangxi.
- ↑ Esta es la misma incertidumbre que existe sobre si el "GUIÓN-MENOS" en ISO/IEC 646 debe asignarse a "GUIÓN" o "SIGNO MENOS" en JIS X 0208.
Notas a pie de página de referencia
- ↑ "Por qué Japón no creó el iPod" . Gatunka . 5 de mayo de 2008.
- ↑ JIS X 0208 no figuraba entre las normas incluidas en la lista de sistemas objetivo aplicables para la visualización de la nueva marca JIS anunciada por el Ministerio de Economía, Comercio e Industria el 17 de enero de 2007.
- 1 2 3 Steele, Shawn (15 de abril de 1998). "CP932.TXT: cp932 a tabla Unicode" . Microsoft.(códigos en formato Shift_JIS; SJIS 0x815C = 1-29 = JIS 0x213D; SJIS 0x817C = 1-61 = JIS 0x215D)
- 1 2 "Mapa (versión externa) de la codificación japonesa de Mac OS a Unicode 2.1 y posterior" . Apple.(códigos en formato Shift_JIS; SJIS 0x815C = 1-29 = JIS 0x213D; SJIS 0x817C = 1-61 = JIS 0x215D)
- 1 2 3 4 Lunde, Ken (21 de marzo de 2019). "Una breve historia de las ligaduras de nombres de era en Japón" . Blog de CJK Type . Adobe Inc.
- 1 2 3 Comité de Normas Industriales Japonesas . ISO-IR-233: Conjunto de caracteres gráficos japoneses para el intercambio de información, plano 1 (actualización de ISO-IR 228) (PDF) . ITSCJ/ IPSJ .
- ↑ Unicode, Inc. (14 de octubre de 2011). "JIS X 0208 (1990) a Unicode" .
- ^ van Kesteren, Anne , "Index jis0208" , Estándar de codificación , WHATWG
- 1 2 Jungshik Shin (14 de octubre de 2011). "KSX1001.TXT: KS X 1001 a tabla Unicode" . Unicode, Inc.
- ↑ La norma JIS C 6225-1979 (códigos de caracteres de control para el conjunto de caracteres gráficos japoneses para el intercambio de información) proporcionaba caracteres de control para el inicio y el final de la composición. La norma JIS C 6225 pasó a denominarse JIS X 0207 en 1987 y fue retirada en 1997.
- ↑ En los conjuntos de caracteres de IANA , Shift JIS se define haciendo referencia al Apéndice 1 de JIS X 0208:1997.
- 1 2 3 4 "15. Historia de JIS X 0208" (PDF) , Conjunto de caracteres gráficos japoneses de IBM para código UNIX extendido (EUC) , IBM, pág. 371, archivado (PDF) del original el 8 de diciembre de 2017 , recuperado el 8 de diciembre de 2017
- ↑ Lunde, Ken. "Apéndice Q § 78-vs-83-3" . Procesamiento de información CJKV (material complementario) . O'Reilly.Nótese la inclusión de códigos kuten sin guion.
- ↑ Lunde, Ken. "Apéndice Q § 78-vs-83-2" . Procesamiento de información CJKV (material complementario) . O'Reilly.Nótese la inclusión de códigos kuten sin guion.
- ↑ Según Nomura (1984), el número de formas de caracteres cambiadas, incluyendo movimientos entre puntos de código, es 294. Según Shibano (1997a) y el texto del cuarto estándar, el número de formas de caracteres cambiadas es 300.
- 1 2 Japonés original:「JIS X 0208が当初符号化を意図していた現代日本語を符号化するために十分な文字集合を提供することを目的として設計された」
- ↑ Lunde, Ken. "Apéndice Q § TJ2" . Procesamiento de la información CJKV (material complementario) . O'Reilly.Nótese la inclusión de códigos kuten sin guion.
- ↑ Por ejemplo, Shibano Kōji (1997a), quien sirvió como presidente del comité de redacción del cuarto estándar, declaró lo siguiente sobre el método de selección: "Se basa en una comprensión superficial de la selección del juego de caracteres de JIS X 0208; es una comprensión errónea" (original japonés:「JIS X 0208の文字集合選定の表層的理解に基づくものであり、間違った理解である」 ) y "Hay un gran problema al investigar todos los personajes conjunto que supere los 10.000 caracteres." (original japonés:「1万字を越える水準の文字集合の検討としては、大きな問題がある」 )
- ↑ Marukawa, Kazushi. "Conjuntos de caracteres JIS – JIS X 0212:1990" . Archivado del original el 22 de mayo de 2005.
- ↑ Chang, Hyeshik (31 de octubre de 2021). "Readme for CJKCodecs" . cPython . Python Software Foundation.
- ↑ JIS X 0213:2000 sección 5.3.2, JIS X 0213:2000 Apéndice 1:2004 sección 3.2.2
Véase también
- Conjuntos de caracteres codificados JIS
- JIS X 0201 "Conjuntos de caracteres codificados de 7 y 8 bits para el intercambio de información"
- JIS X 0202 "Tecnología de la información: estructura del código de caracteres y técnicas de extensión" ( ISO/IEC 2022 )
- JIS X 0208 "Conjuntos de caracteres KANJI codificados con doble byte de 7 y 8 bits para el intercambio de información"
- JIS X 0211 "Funciones de control para conjuntos de caracteres codificados" ( ISO/IEC 6429 )
- JIS X 0212 "Código del conjunto suplementario de caracteres gráficos japoneses para el intercambio de información"
- JIS X 0213 "Conjuntos de caracteres KANJI extendidos de 7 y 8 bits con codificación de doble byte para el intercambio de información"
- JIS X 0221 "Conjunto de caracteres codificados de múltiples octetos universales (UCS)" ( ISO/IEC 10646 )
- Shinjitai extendido
- Ayuda: Japonés
Referencias
A efectos de citación, estos nombres japoneses se presentan como si estuvieran en orden occidental cuando están romanizados, y conservan el orden oriental cuando no lo están.
- Nishimura, Hirohiko [西村 恕彦] , 1978. El kanji JIS [漢字のJIS ] . Diario de estandarización [標準化ジャーナル] , 171: 3–8.
- Nomura, Masaaki [野村 雅昭] , 1984. Revisión de JIS C 6226: Códigos kanji para intercambio de información [ JIS C 6226 情報交換用漢字符号系の改正] . Diario de estandarización [標準化ジャーナル] , 14 (3): 4–9.
- Ogata, Katsuhiro [小形 克宏] , 2006a. Las cosas que no estaban unificadas en 97JIS entre los glifos de ejemplo cambiaron en JIS C 6226-1983 (83JIS) ( JIS C 6226-1983 (83JIS)で例示字体を変更したうち、97JISで包摂とされなかったもの) (consultado el 29 de enero de 2007).
- Ogata, Katsuhiro [小形 克宏] , 2006b. Las cosas que estaban dentro del alcance de la unificación entre los glifos de ejemplo cambiaron en JIS C 6226-1983 (83JIS) ( JIS C 6226-1983 (83JIS)例示字体変更のうち、包摂の範囲内だったもの) (consultado el 29 de enero de 2007).
- Satō, Takayuki [佐藤 敬幸] , 2004. Respecto a la revisión de JIS X 0213 (conjuntos de kanji extendidos codificados de doble byte de 7 y 8 bits para el intercambio de información) [ JIS X 0213 (7ビット及び8ビットの2バイト情報交換用符号化拡張漢字集合) の改正について] . Diario de estandarización [標準化ジャーナル] , 34 (4): 8–12.
- Shibano, Kōji [芝野 耕司] , 1997a. Con respecto a la revisión de JIS X 0208 (conjuntos de kanji codificados de doble byte de 7 y 8 bits para el intercambio de información) [ JIS X0208 (7ビット及び8ビットの2バイト情報交換用符号化漢字集合) の改正について] . Diario de estandarización [標準化ジャーナル] , 27 (3): 8–12.
- Shibano, Kōji [芝野 耕司] , 1997b. Plan para la extensión del kanji JIS [ JIS漢字の拡張計画] . Diario de estandarización [標準化ジャーナル] , 27 (7): 5–11.
- Shibano, Kōji [芝野 耕司] , 2000. Establecimiento de JIS X 0213 (conjuntos de kanji extendidos codificados de doble byte de 7 y 8 bits para el intercambio de información) [ JIS X 0213 (7ビット及び8ビットの2バイト情報交換用符号化拡張漢字集合) の制定] . Diario de estandarización [標準化ジャーナル] , 30 (3): 3–7.
- Shibano, Kōji [芝野 耕司] , 2001. Respecto a los kanji JIS [漢字について] . Estandarización y control de calidad [標準化と品質管理] , 54 (8): 44–50.
- Shibano, Kōji [芝野 耕司] (editor), 2002. Diccionario JIS Kanji, edición ampliada y revisada [増補改訂 JIS漢字字典] . Tokio: Asociación Japonesa de Normas ( ISBN 4-542-20129-5).
- Shibano, Kōji [芝野 耕司] , 2002. El desarrollo de las tecnologías de procesamiento del idioma japonés y kanji: la estandarización de los códigos kanji [漢字・日本語処理技術の発展:漢字コードの標準化] . Revista IPSJ [情報処理] , 43 (12): 1362–1367
- Tajima, Kazuo [田嶋 一夫] , 1979. Problemas relacionados con el uso del listado de kanji JIS: diseño y manejo de kanji en sistemas de procesamiento de kanji [ JIS漢字表の利用上の問題:漢字処理システムにおける漢字のデザインと管理] . Revista de la Sociedad de Procesamiento de Información de Japón [情報管理] , 21 (10): 753–761.
- Uchida, Tomio [内田 富雄] , 1990. Establecimiento de JIS X 0212 (Códigos Kanji para el intercambio de información – Kanji suplementario) [ JIS X 0212 (情報交換用漢字符号―補助漢字)の制定] . Diario de estandarización [標準化ジャーナル] , 20 (11): 6–11.
- Yasuoka, Kōichi [安岡 孝一] , 2001a. Situación de los códigos de caracteres más nuevos en Japón (parte anterior) [日本における最新文字コード事情 (前編) ] . Sistemas, control e información [システム/制御/情報] , 45 (9): 528–535.
- Yasuoka, Kōichi [安岡 孝一] , 2001b. Situación de los códigos de caracteres más nuevos en Japón (última parte) [日本における最新文字コード事情 (後編) ] . Sistemas, control e información [システム/制御/情報] , 45 (12): 687–694.
- Yasuoka, Kōichi [安岡 孝一] , 2006 "Diferencias entre el plan de kanji JIS (1976) y JIS C 6226-1978" [ JIS漢字案 (1976) とJIS C 6226-1978の異同] en el 17º "Computadora Uso para estudios orientales" [東洋学へのコンピュータ利用] seminario de investigación. 3–51.
- Yasuoka, Kōichi [安岡 孝一] y Motoko Yasuoka [安岡 素子] , 2006. La historia de los códigos de caracteres: Europa, América y Japón [文字符号の歴史: 欧米と日本編] . Tokio: Kyōritsu Shuppan ( ISBN 4-32012102-3).
Enlaces externos
- El Registro Internacional se archivó el 12 de mayo de 2023 en la Wayback Machine que supervisa la IPSJ/ITSCJ.
- Conjunto de caracteres japoneses JIS C 6226-1978
- Conjunto de caracteres japoneses JIS C 6226-1983
- Actualización del registro 87 del conjunto de caracteres gráficos japoneses para el intercambio de información.
- (en japonés) Búsqueda en la base de datos del Comité de Normas Industriales de Japón (la norma más reciente se puede consultar aquí).
- (en japonés) Búsqueda en la base de datos de la Asociación Japonesa de Normalización : (aquí se puede adquirir una copia de la norma más reciente).
- (en japonés) Disposiciones relacionadas con la unificación en las normas JIS X 0208 y 0213
- (en japonés) Bibliotecario cibernético – Listado de kanji JIS
- Conjuntos de caracteres
- Codificaciones del japonés
- Normas JIS
- Introducciones relacionadas con la informática en 1978