Articulo de referencia

TRON (codificación)

TRON Code es una codificación de caracteres multibyte utilizada en el proyecto TRON . Es similar a Unicode , pero no utiliza su proceso de unificación Han : cada carácter de cad...

TRON Code es una codificación de caracteres multibyte utilizada en el proyecto TRON . Es similar a Unicode , pero no utiliza su proceso de unificación Han : cada carácter de cada conjunto de caracteres CJK se codifica por separado, incluyendo los equivalentes arcaicos e históricos de los caracteres modernos. Esto significa que se puede mezclar texto chino, japonés y coreano sin ambigüedad en cuanto a la forma exacta de los caracteres; sin embargo, también implica que muchos caracteres con semántica equivalente se codificarán más de una vez, lo que complica algunas operaciones.

TRON tiene capacidad para 150 millones de puntos de código. Puntos de código separados para las variantes chinas, coreanas y japonesas de los más de 70 000 caracteres Han en Unicode 4.1 (si se considerara necesario) requerirían más de 200 000 puntos de código en TRON. TRON incluye los caracteres no Han de Unicode 2.0, pero no se ha mantenido actualizado con las ediciones recientes de Unicode a medida que Unicode se expande más allá del Plano Multilingüe Básico y agrega caracteres a los sistemas de escritura existentes. La codificación TRON se ha actualizado para incluir otras actualizaciones recientes de páginas de códigos como JIS X 0213. [ 1 ]

Existen fuentes para la codificación TRON, pero tienen restricciones para su uso comercial. [ 2 ]

Estructura

Cada carácter en TRON Code se codifica como dos bytes (siempre que esté presente en el plano de codificación actual). De manera similar a ISO/IEC 2022 , la codificación de caracteres de TRON maneja caracteres en múltiples conjuntos de caracteres dentro de una sola codificación de caracteres mediante el uso de secuencias de escape, denominadas códigos especificadores de idioma, para cambiar entre planos de 48 400 puntos de código. Los conjuntos de caracteres incorporados en TRON Code incluyen conjuntos de caracteres existentes como JIS X 0208 y GB 2312 , así como otras fuentes de caracteres como Dai Kan-Wa Jiten y algunos sistemas de escritura no incluidos en otras codificaciones, como los símbolos Dongba .

Debido a la incorporación de conjuntos de caracteres completos en TRON Code, muchos caracteres con semántica equivalente se codifican varias veces; por ejemplo, todos los caracteres kanji en la tipografía GT reciben sus propios puntos de código, a pesar de que muchos de ellos se superponen con otros conjuntos de caracteres kanji que ya están incluidos, como JIS X 0208. Un ejemplo de ello es el carácter 亜 (ubicado en Unicode en U+4E9C) que aparece en la región JIS X 0208 en 1-3021 , en la región de la tipografía GT en 2-2464 y en la región Dai Kan-Wa Jiten en 8-2373 .

Códigos de control

Los bytes comprendidos entre 0x00 y 0x20, así como 0x7F, están reservados para su uso en códigos de control.

Códigos de caracteres

Los caracteres de cada plano se dividen en cuatro zonas. Cada zona se asigna por separado; por ejemplo, en el plano 1, los caracteres JIS X 0208 se encuentran en la Zona A a partir de la dirección 0x2121, los caracteres JIS X 0213 se encuentran tanto en la Zona A como en la Zona B, y los caracteres GB 2312 se encuentran en la Zona C a partir de la dirección 0x2180.

Los puntos de código de TRON se denotan como X-YYYY , donde X es el número de plano en decimal y YYYY es el punto de código en hexadecimal. Alternativamente, se puede usar la notación 0xNNYYYY , donde NN es el segundo byte en hexadecimal del código del especificador de lenguaje. Se puede usar un formato de texto &TNNYYYY; para denotar un punto de código de TRON en texto ASCII, de manera similar a las referencias de caracteres numéricos en HTML, SGML o XML . Sin embargo, un analizador HTML o XML estándar y conforme los trataría como entidades con nombre, que no se pueden asignar directa y fácilmente a secuencias válidas e inequívocas de puntos de código en el UCS, sin una DTD extensa para definirlos (posiblemente usando algunos caracteres de uso privado para escapes de TRON, o selectores de variación Unicode asignados a caracteres TRON para codificar diferentes caracteres TRON representados como el mismo carácter en el UCS): se necesitará un analizador diferente basado en SGML para admitir el formato de texto TRON de una manera interoperable con los UTF estándar para el UCS.

Códigos especificadores de idioma

Los códigos de especificación de idioma tienen como prefijo 0xFE. Los sufijos válidos son de 0x21 a 0x7E (que hacen referencia a los planos del 1 al 94) y de 0x80 a 0xFE (para planos futuros), muchos de los cuales no están asignados.

Códigos especiales y de escape

Los códigos especiales tienen como prefijo 0xFF.

Aviones

A continuación se detallan los planos asignados para su uso en el código TRON, junto con sus códigos especificadores de lenguaje correspondientes y una descripción de los conjuntos de caracteres incluidos en cada plano.

Los planos del 11 al 15 se destinaron originalmente a almacenar el conjunto de caracteres Mojikyō , pero las disputas han provocado su exclusión. Todos los demás planos, hasta el 31, están reservados para su futura asignación.

Véase también

  • TRONコード体系Sistema de código Tron en el documento de especificación BTRON
  • TRON文字収録センターCentro de colección de personajes de Tron
  • 超漢字Sistema operativo con estándar BTRON
  • GT明朝Tron GT-Mincho fuente
  • Archivo del proyecto ITRON
  • Página de personaje activa de TRON
  • Manejo de caracteres chinos y código TRON

Referencias

  1. "El nombre del foro T-Engine se cambió a foro TRON" . T-engine.org. 1 de abril de 2015. Consultado el 16 de septiembre de 2018 .
  2. ^ "Tフォントプロジェクト 利用規定" . Charcenter.t-engine.org. Archivado desde el original el 19 de abril de 2011 . Consultado el 16 de septiembre de 2018 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=TRON_(encoding)&oldid=1344013160 "