Articulo de referencia

Código de escritura tamil para el intercambio de información

El código TSCII ( Tamil Script Code for Information Interchange ) es un esquema de codificación para representar la escritura tamil . Los 128 puntos de código inferiores son ASC...

El código TSCII ( Tamil Script Code for Information Interchange ) es un esquema de codificación para representar la escritura tamil . Los 128 puntos de código inferiores son ASCII estándar , y los 128 puntos de código superiores son específicos de TSCII. Tras muchos años de uso exclusivo en Internet mediante acuerdos privados, fue registrado con éxito en la IANA en 2007. [ 1 ]

TSCII codifica los caracteres en orden visual (escrito), de forma similar al uso de la máquina de escribir tamil. Unicode , en cambio, utiliza la estrategia de codificación de orden lógico para el tamil, siguiendo a ISCII , a diferencia del caso del tailandés , donde se adoptó la codificación de orden visual heredada de TIS-620 .

El gobierno de Tamil Nadu respalda sus propios estándares TAB/TAM para la codificación de 8 bits, aunque todavía se pueden encontrar en la web otros esquemas de codificación más antiguos.

Historia

A mediados de la década de 1990, los miembros de diversos foros basados ​​en listas de correo electrónico sintieron la necesidad de una codificación común para el tamil, dado que predominaban en dichos foros múltiples fuentes con codificación personalizada. Si bien algunas codificaciones comerciales eran más populares que otras, no fueron aceptadas por la comunidad en general debido a intereses comerciales contrapuestos. Aunque Unicode era aceptado por la mayoría como el estándar futuro, la mayoría de los sistemas de escritorio de la época aún no eran capaces de manejar Unicode para el idioma tamil, por lo que se requirió una codificación provisional de 8 bits.

En 1997 se creó una lista de correo independiente para debatir sobre dichas codificaciones (webmasters@Tamil.net) con el fin de iniciar este debate, a partir de un correo electrónico escrito por el Dr. K. Kalyanasundaram a la popular autora tamil Sujatha , quien dirigía el comité para la estandarización del teclado tamil. [ 2 ] Este foro atrajo rápidamente a participantes entusiastas de todo el mundo, incluidos varios destacados académicos tamiles. INFITT mantiene los archivos de estas discusiones . [ 3 ]

Tras la publicación de TSCII, la mayoría de los miembros de la lista de correo webmasters@Tamil.net pasaron a formar parte de INFITT, una iniciativa más amplia para impulsar la estandarización y el desarrollo continuo en diversas áreas de la informática tamil.

Diseño de la página de códigos

  1. U+0BE6 DÍGITO CERO TAMIL, que se añadió con la versión 4.1 de Unicode en marzo de 2005.

Herramientas de conversión

El texto codificado en UTF-8 se puede convertir a TSCII utilizando las herramientas GNU iconv de la siguiente manera:

$ iconv -f utf-8 -t tscii hello.utf8 > hello.tscii 

Mientras que la conversión de TSCII a UTF-8 se realiza intercambiando las banderas -f y -t .

Véase también

Referencias

  1. "Nombre del conjunto de caracteres: TSCII (CÓDIGO DE ESCRITURA TAMIL PARA INTERCAMBIO DE INFORMACIÓN)" (TXT) . www.iana.org . IANA .
  2. "Una propuesta para un esquema de codificación de fuentes para tamil" .
  3. "Discusión en tamil en webmasters@tamil.net" .
  • Página de inicio TSCII
  • Nota técnica Unicode n.º 15 Conversión de texto de TSCII 1.7 a Unicode
  • INFITT (Foro Internacional de Tecnologías de la Información en Tamil)
  • Conversión en línea y de páginas web de TSCII a Unicode
  • Padma – Extensión de Mozilla para transformar TSCII a Unicode. Archivada el 1 de octubre de 2019 en Wayback Machine.
  • La colección gratuita de textos electrónicos del Proyecto Madurai utiliza la codificación TSCII, pero ya ha comenzado a proporcionar versiones Unicode.
  • AnyTaFont2UTF8 : un proyecto de código abierto para todos los caracteres de codificación/mapeo de fuentes tamil, mantenido por la comunidad tamil Isaiyini.