Articulo de referencia

Codificación JIS

En informática, la codificación JIS hace referencia a varios estándares industriales japoneses para codificar el idioma japonés . [1] Estrictamente hablando, el término signific...

En informática, la codificación JIS hace referencia a varios estándares industriales japoneses para codificar el idioma japonés . [1] Estrictamente hablando, el término significa:

  • Un conjunto de caracteres codificados estándar para japonés, en particular:
    • JIS X 0201 , la versión japonesa de ISO 646 ( ASCII ) que contiene los caracteres ASCII básicos de 7 bits (con algunas modificaciones) y 64 caracteres katakana de ancho medio.
    • JIS X 0208 , el conjunto de caracteres kanji más común que contiene 6.879 caracteres, incluidos 6.355 kanji y 524 caracteres más (un plano de 94 x 94)
    • JIS X 0212 , un suplemento para JIS X 0208 que añade 5.801 kanji, lo que da un total de 12.156 kanji (un segundo plano de 94 por 94)
    • JIS X 0213 , que amplía JIS X 0208 (dos planos)
  • JIS X 0202 (también conocido como ISO-2022-JP), un conjunto de mecanismos de codificación para enviar datos de caracteres JIS a través de medios de transmisión que solo admiten datos de 7 bits.

En la práctica, la "codificación JIS" suele referirse a datos de caracteres JIS X 0208 codificados con JIS X 0202. Por ejemplo, la IANA utiliza la JIS_Encodingetiqueta para referirse a JIS X 0202, y la ISO-2022-JPetiqueta para referirse a su perfil definido por RFC  1468. [2]

Otros mecanismos de codificación para caracteres JIS incluyen la codificación Shift JIS y EUC-JP . Shift JIS agrega los kanji, hiragana de ancho completo y katakana de ancho completo de JIS X 0208 a JIS X 0201 de manera compatible con versiones anteriores. [3] Shift JIS es quizás la codificación más utilizada en Japón, ya que la compatibilidad con el conjunto de caracteres de un solo byte JIS X 0201 hizo posible que los fabricantes de equipos electrónicos (como los fabricantes de cajas registradoras) ofrecieran una actualización de equipos más antiguos y más baratos que no eran capaces de mostrar kanji a equipos más nuevos, manteniendo la compatibilidad del conjunto de caracteres.

EUC-JP se utiliza en sistemas UNIX , donde las codificaciones JIS son incompatibles con los estándares POSIX .

Una alternativa más reciente a los caracteres codificados JIS es Unicode ( caracteres codificados UCS ), particularmente en el mecanismo de codificación UTF-8 .

Comparación de codificación

La siguiente tabla compara las características de los tres esquemas de codificación principales para JIS X 0208.

  1. ^ ie no requiere transmisión limpia de 8 bits .
  2. ^ es decir, la secuencia utilizada para codificar un carácter determinado es siempre la misma, sin importar cuáles hayan sido los caracteres anteriores. Véase estado (informática) .
  3. ^ ab ISO-2022-JP es una codificación con estado : todos los conjuntos de caracteres se codifican sobre 0x21–7E y se alternan entre ellos mediante escapes ANSI. Por lo tanto, si bien es ASCII en su estado inicial, secuencias completas de caracteres no ASCII se pueden codificar con bytes ASCII.
  4. ^ Los katakana JIS X 0201 están disponibles en JIS X 0202 e ISO 2022, pero no están incluidos en el perfil básico ISO-2022-JP, aunque son una extensión común.
  5. ^ JIS X 0212 está disponible en JIS X 0202 e ISO 2022, y está incluido en los perfiles ISO-2022-JP-1 e ISO-2022-JP-2, pero no en el perfil básico ISO-2022-JP.
  6. ^ Los caracteres de un solo byte 0x21–7E en Shift_JIS son correctamente ISO-646-JP , para ser un superconjunto de JIS X 0201 de 8 bits, pero a menudo se decodifican (no necesariamente se muestran) como ASCII, que difiere solo en dos lugares.
  7. ^ Algunos bytes ASCII (no todos) pueden aparecer como segundos bytes, pero no primeros bytes, de caracteres de doble byte en Shift_JIS. Por lo tanto, en una secuencia de dos o más bytes ASCII, el segundo byte en adelante son necesariamente caracteres ASCII (o ISO-646-JP).
  8. ^ El formato EUC empaquetado se basa en los mecanismos ISO 2022, con designaciones de conjuntos de caracteres preestablecidas. Se evitan los escapes de designación de conjuntos de caracteres y los cambios de bloqueo, mientras que el uso de cambios simples se puede implementar de manera no estatal. No obstante, se respetan las restricciones de ISO 2022.
  9. ^ Los caracteres de un solo byte 0x21–7E en EUC-JP generalmente se consideran ASCII, pero a veces se tratan como ISO-646-JP .
  10. ^ A diferencia de Shift_JIS, EUC-JP no manejará una entrada JIS X 0201 simple de 8 bits sin una conversión previa, debido a la diferente representación del katakana JIS X 0201 (con cambios simples).
  11. ^ JIS X 0212 en EUC-JP no siempre se implementa.
  12. ^ Además de las propiedades de las codificaciones en sí, los formatos Unicode tienen otras ventajas derivadas del conjunto de caracteres subyacente: no se limitan a los caracteres codificados JIS, sino que pueden representar la totalidad de UCS (incluido el repertorio completo de caracteres codificados JIS) y, por lo tanto, son adecuados para el uso internacional. También se ven menos afectados por la colisión de extensiones propietarias, debido a su mayor repertorio base y a las áreas de uso privado designadas.
  13. ^ La mayoría de los desplazamientos de marco bit a bit de texto codificado en UTF-8 producirán UTF-8 no válido, pero es posible construir secuencias de caracteres que sigan siendo UTF-8 válidos incluso cuando se desplazan uno o más bits.
  14. ^ Sólo por Microsoft.
  15. ^ Si bien GB 18030 y GBK son extensiones del formato EUC-CN de GB/T 2312, no siguen las restricciones de EUC o ISO 2022, a diferencia de EUC-JP (o el EUC-CN original).
  16. ^ Aunque, en teoría, UTF-32 se sincroniza automáticamente solo en dwords de 32 bits, el uso de un valor de 32 bits para representar un valor de 21 bits significa que, en la práctica, UTF-32 contiene una serie continua de al menos 11 bits cero en el extremo superior de cada carácter, que generalmente se pueden usar para alinearse con los límites de los caracteres, dependiendo de los puntos de código involucrados.

Véase también

Referencias

  1. ^ Haralambous, Yannis (2007). Fuentes y codificaciones . O'Reilly Media . Págs.  42-44 . ISBN. 9780596102425.
  2. ^ "Conjuntos de caracteres". IANA.
  3. ^ Lunde, Ken (2009). Procesamiento de Información CJKV . Medios O'Reilly . págs.  262–268 . ISBN 9780596514471.
Obtenido de "https://es.wikipedia.org/w/index.php?title=Codificación_JIS&oldid=1187947658"