Articulo de referencia

Conjunto de caracteres de doble byte

Un conjunto de caracteres de doble byte ( DBCS ) es una codificación de caracteres en la que todos los caracteres (incluidos los caracteres de control ) se codifican en dos byte...

Un conjunto de caracteres de doble byte ( DBCS ) es una codificación de caracteres en la que todos los caracteres (incluidos los caracteres de control ) se codifican en dos bytes, o bien, cada carácter gráfico no representable por un conjunto de caracteres de un solo byte ( SBCS ) se codifica en dos bytes ( los caracteres Han generalmente comprenden la mayoría de estos caracteres de dos bytes). Un DBCS admite idiomas nacionales que contienen muchos caracteres o símbolos únicos (el número máximo de caracteres que se pueden representar con un byte es de 256 caracteres, mientras que dos bytes pueden representar hasta 65 536 caracteres). Ejemplos de estos idiomas son el coreano , el japonés y el chino . El coreano Hangul no contiene tantos caracteres, pero KS X 1001 admite tanto Hangul como Hanja , y utiliza dos bytes por carácter.

En computación CJK

El término DBCS se refiere tradicionalmente a una codificación de caracteres en la que cada carácter gráfico se codifica en dos bytes.

En un código de 8 bits, como Big-5 o Shift JIS , un carácter del DBCS se representa con un byte inicial con el bit más significativo activado (es decir, mayor que siete bits) y se combina con un conjunto de caracteres de un solo byte (SBCS). Para mantener la compatibilidad con software estándar sin modificar, el SBCS se asocia con caracteres de ancho medio y el DBCS con caracteres de ancho completo . En un código de 7 bits, como ISO-2022-JP , se utilizan secuencias de escape o códigos de desplazamiento para alternar entre el SBCS y el DBCS.

En ocasiones, el uso del término "DBCS" puede implicar una estructura subyacente que no cumple con la norma ISO 2022. Por ejemplo, "DBCS" a veces puede referirse a una codificación de doble byte que no es específicamente Código Unix Extendido (EUC).

El significado original de DBCS difiere de lo que algunos consideran el uso correcto en la actualidad. Algunos insisten en que estas codificaciones de caracteres se denominen correctamente conjuntos de caracteres multibyte (MBCS) o codificaciones de ancho variable , porque codificaciones como EUC-JP , EUC-KR , EUC-TW , GB 18030 y UTF-8 utilizan más de dos bytes para algunos caracteres y admiten un byte para otros.

Ambigüedad

Algunas personas usan el término DBCS para referirse a las codificaciones UTF-16 y UTF-8 , mientras que otras lo usan para referirse a codificaciones de caracteres más antiguas (anteriores a Unicode ) que usan más de un byte por carácter. Shift JIS , GB 2312 y Big5 son algunas codificaciones de caracteres que pueden contener más de un byte por carácter, pero incluso usar el término DBCS para estas codificaciones es una terminología incorrecta, ya que en realidad son codificaciones de ancho variable (al igual que UTF-16 y UTF-8). Algunos mainframes de IBM sí tienen páginas de códigos DBCS auténticas, que contienen solo la parte de doble byte de una página de códigos multibyte.

Si alguien utiliza el término "habilitación de DBCS" para referirse a la internacionalización de software , está empleando una terminología ambigua. Puede que se refiera a que quiere desarrollar software para los mercados de Asia Oriental utilizando tecnología antigua con páginas de códigos, o que planea usar Unicode. A veces, este término también implica la traducción a un idioma de Asia Oriental. Normalmente, "habilitación de Unicode" significa internacionalizar el software mediante Unicode, mientras que "habilitación de DBCS" significa utilizar codificaciones de caracteres incompatibles entre los distintos países de Asia Oriental para la internacionalización del software. Dado que Unicode, a diferencia de muchas otras codificaciones de caracteres, admite todos los idiomas principales de Asia Oriental, generalmente es más fácil habilitar y mantener el software que utiliza Unicode. La habilitación de DBCS (no Unicode) suele ser deseable solo cuando los sistemas operativos o aplicaciones mucho más antiguos no son compatibles con Unicode.

TBCS

Un conjunto de caracteres de triple byte (TBCS, por sus siglas en inglés) es una codificación de caracteres en la que los caracteres (incluidos los caracteres de control) se codifican en tres bytes.

Véase también

  • Definición de Microsoft de "conjunto de caracteres de doble byte"
  • Definición de IBM de "conjunto de caracteres de doble byte" en Wayback Machine (archivada el 18 de octubre de 2018).