La codificación de todos los caracteres tamiles ( TACE16 ) es un esquema para codificar la escritura tamil en el Área de Uso Privado de Unicode , que implementa un modelo de caracteres basado en silabarios que difiere del modelo ISCII modificado utilizado por la implementación tamil existente de Unicode . [ 1 ] [ 2 ]
Controladores de teclado y fuentes
El controlador de teclado para este esquema de codificación está disponible gratuitamente en el sitio web de la Academia Virtual Tamil . [ 3 ] [ 4 ] Utiliza los diseños de teclado Tamil 99 y Tamil Typewriter , aprobados por el Gobierno de Tamil Nadu , y asigna las pulsaciones de teclas de entrada a sus caracteres correspondientes del esquema TACE16. [ 2 ] Para leer archivos creados con TACE16, las fuentes Unicode Tamil correspondientes también están disponibles en el mismo sitio web. [ 3 ] [ 4 ] Estas fuentes asignan glifos para caracteres del formato TACE16, pero también para el bloque Unicode para caracteres ASCII y Tamil , de modo que pueden proporcionar compatibilidad con versiones anteriores para leer archivos existentes que se crean utilizando el bloque Unicode Tamil .
Conjunto de caracteres
Todos los caracteres de este esquema de codificación se encuentran en el área de uso privado del Plano Multilingüe Básico del Conjunto de Caracteres Codificados Universales de Unicode .
Comparación de TACE16 con el Unicode tamil actual.
Críticas al modelo de caracteres Unicode estándar para el tamil.

El modelo de caracteres Unicode existente para el tamil es, como la mayoría de los Unicode índicos , [ b ] un modelo basado en abugida derivado de ISCII . Ha sido criticado por varias razones. [ 1 ]
Unicode representa solo 31 caracteres base tamiles como puntos de código individuales , de un total de 247 grupos de grafemas . Estos incluyen vocales independientes y 23 glifos consonánticos básicos (que, al no contener un virama , denotan una sílaba con consonante y vocal cuando se usan solos). Los demás se representan como secuencias de puntos de código, lo que requiere compatibilidad de software con funciones tipográficas avanzadas (como Apple Advanced Typography , Graphite u OpenType ) para su correcta visualización. Esto también exige el uso de caracteres invisibles de unión y de no unión de ancho cero en lugares donde el grupo de grafemas deseado resultaría ambiguo. Esta complejidad puede generar vulnerabilidades de seguridad y combinaciones ambiguas, requerir el uso de una tabla de excepciones para prohibir combinaciones no válidas de puntos de código y hacer necesaria la normalización de cadenas para comparar la igualdad entre dos cadenas .
Además, dado que las sílabas con consonante y vocal constituyen entre el 64 y el 70 % del texto tamil, un modelo basado en abugida, que codifica las partes consonántica y vocálica como puntos de código separados, resulta ineficiente en términos de la longitud necesaria de una cadena para contener un fragmento de texto determinado, en comparación con un modelo basado en silabarios.
Además, ISCII es principalmente una codificación de Devanagari , y las codificaciones ISCII de otras escrituras bráhmicas (incluido el tamil) codifican caracteres sobre los puntos de código de los caracteres correspondientes en Devanagari ISCII. Aunque Unicode codifica las escrituras bráhmicas por separado, el bloque de tamil refleja la disposición ISCII (con un orden de caracteres al estilo de Devanagari y espacio reservado en las posiciones correspondientes a caracteres devanagari sin equivalente en tamil); por consiguiente, los caracteres no están en el orden de secuencia natural, y las cadenas ordenadas por punto de código (análogas a la ordenación " ASCIIbetical " del texto en inglés) no producirán el orden de ordenación esperado. Se requiere un algoritmo de ordenación complejo para organizarlos en el orden natural.
TACE16 en comparación
Los siguientes datos proporcionan una comparación del Unicode Tamil actual frente a TACE16 en materia de gobierno electrónico y navegación: [ 1 ]
- TACE16 es entre un 5,46 y un 11,94 por ciento más eficiente que Unicode Tamil para el almacenamiento de datos .
- TACE16 es entre un 18,69 y un 22,99 por ciento más eficiente que Unicode Tamil para la clasificación de datos de índice.
- TACE16 es un 25,39 % más eficiente que Unicode Tamil cuando todos los datos están en tamil. La secuencia de intercalación predeterminada (binaria) que se sigue al usar los valores del espacio de códigos en TACE16 no se ajusta al orden del diccionario tamil.
- TACE16 es más rápido en la clasificación que Unicode Tamil, con una diferencia de entre el 0,31 y el 16,96 por ciento.
- La creación de índices en datos TACE16 es un 36,7 % más rápida que en Unicode.
- Para la búsqueda por clave completa en campos indexados, TACE16 ofrece un rendimiento superior al de Unicode Tamil hasta en un 24,07 %. En el caso de campos no indexados, TACE16 ofrece un rendimiento superior al de Unicode Tamil hasta en un 20,9 %.
- La representación de datos estáticos en tamil funciona con TACE16.
TACE16 ofrece mejoras de rendimiento en tiempo y espacio de procesamiento. Abarca todo el texto general en tamil; es secuencial; y es inequívoco, ya que cada punto corresponde a un solo carácter. [ 1 ] El sistema TACE16 requiere menos ciclos de instrucción que Unicode Tamil, y también permite la programación basada en la gramática tamil, que requiere un desarrollo de marco adicional en Unicode Tamil.
Respuestas del Consorcio Unicode
El Consorcio Unicode publica una página de preguntas frecuentes dedicada al alfabeto tamil que responde a algunas de las críticas. En defensa del modelo ISCII, el Consorcio señala que en su desarrollo participaron lingüistas , tipógrafos y programadores expertos, pero reconoce que se hicieron concesiones debido a que ISCII está limitado a ASCII extendido de un solo byte . El Consorcio destaca que Unicode Tamil ya está implementado en todos los principales sistemas operativos y navegadores web , y sostiene que debería utilizarse en contextos de intercambio abierto, como en línea, ya que herramientas como los motores de búsqueda no necesariamente podrían identificar o interpretar una secuencia de puntos de código Unicode de uso privado como texto tamil. Sin embargo, el Consorcio no se opone al uso de esquemas de Área de Uso Privado, incluido TACE16, internamente para procesos específicos para los que resulten útiles. En particular, subraya que tanto los esquemas de marcado como los esquemas de codificación alternativos pueden ser utilizados por investigadores para fines especializados, como el procesamiento del lenguaje natural . [ 6 ]
Unicode define secuencias normativas con nombre para todas las consonantes y sílabas puras del tamil que se representan con secuencias de más de un punto de código, y se publica una tabla específica como parte del estándar Unicode que enumera todas estas secuencias, en su orden tradicional, junto con sus glifos correctos. El Consorcio señala que ha estado abierto a aceptar propuestas para caracteres para los que no existe una representación Unicode: por ejemplo, la adición de varias fracciones históricas y otros símbolos como bloque del Suplemento Tamil en la versión 12.0 en 2019. [ 6 ]
En cuanto a la intercalación, el Consorcio argumenta que obtener el resultado correcto al ordenar por punto de código es la excepción y no la regla, destacando que, en el ordenamiento ASCIIbetical sin modificar , la letra latina mayúscula Z se ordena antes que la letra minúscula a , y también destacando que las reglas de intercalación a menudo difieren según el idioma (véase, por ejemplo, ö ). En cuanto a la eficiencia del espacio, el Consorcio argumenta que el espacio de almacenamiento y el ancho de banda ocupados por el texto generalmente se ven eclipsados por otros medios que lo acompañan, como imágenes y vídeo, y que el contenido de texto funciona bien con métodos de compresión de propósito general como Deflate (originalmente del formato de archivo ZIP , estandarizado en RFC 1951 e integrado en el protocolo HTTP como un esquema de codificación genérico). [ 6 ]
Política de estabilidad de Unicode
Cuando se publicó por primera vez (versión 1.0.0), Unicode solo ofrecía garantías de estabilidad limitadas. Por ello, el bloque tibetano original se eliminó en la versión 1.0.1 (y su espacio ha sido ocupado desde entonces por el bloque birmano ), y el bloque original para sílabas coreanas se eliminó en la versión 2.0 (y ahora está ocupado por la Extensión A de Ideogramas Unificados CJK ). Tanto el bloque actual de Sílabas Hangul para sílabas coreanas como el bloque tibetano actual datan de Unicode 2.0. Esto se hizo bajo el supuesto de que existía poco o ningún contenido existente que utilizara Unicode para esos sistemas de escritura, [ 7 ] ya que rompería la compatibilidad con todo el contenido Unicode existente y los métodos de entrada para esos sistemas de escritura. Después de este llamado "caos coreano", los comités responsables se comprometieron a no volver a realizar un cambio que rompiera la compatibilidad, [ 7 ] lo que ahora forma parte de la Política de Estabilidad de Unicode. [ 8 ]
Esta política de estabilidad se ha mantenido desde entonces, a pesar de las demandas de volver a codificar o cambiar el modelo de caracteres tanto para el tibetano como para el coreano por segunda vez, hechas por China y Corea del Norte respectivamente. [ 9 ] [ 10 ] [ 11 ] [ 12 ] De igual modo en relación con el tamil, el Consorcio enfatiza la "cuestión crucial de mantener la estabilidad del estándar para las implementaciones existentes" y argumenta que "los costos y el impacto resultantes de desestabilizar el estándar" superarían sustancialmente cualquier beneficio de eficiencia en velocidad de procesamiento o espacio de almacenamiento. [ 6 ]
Hubo una propuesta para recodificar el tamil [ 13 ] que fue rechazada por Unicode, que dijo que la recodificación sería perjudicial y que no había evidencia convincente de que la codificación del tamil de Unicode fuera deficiente. [ 14 ]
Alternativas
Tamil abierto
El proyecto Open-Tamil [ 15 ] proporciona muchas de las operaciones comunes. Afirma cumplir con el Nivel 1 de procesamiento de texto tamil sin usar TACE16, pero está escrito sobre una lógica de programación adicional que se necesita para el tamil Unicode.
Véase también
- Código de escritura tamil para el intercambio de información
- teclado tamil
- தமிழ் 99
- InScript
- Tamil (bloque Unicode)
- Blogosfera tamil
- AnyTaFont2UTF8 : un proyecto de código abierto para todos los caracteres de codificación/mapeo de fuentes tamil.
Notas a pie de página
- ^ Los silabogramas resaltados en las columnas U y Ū son aquellos en los que la parte vocálica del glifo no coincide ni con las formas de subunión simples que se muestran para aquellos que combinan marcas vocálicas en la tabla de bloques Unicode, ni con las formas de unión derecha de Grantha (como las que se utilizan para aquellos que combinan marcas vocálicas de forma aislada, por ejemplo, en las fuentes Noto ).
- ^ Excepto para el tibetano , que utiliza un modelo diferente, y para el tailandés y escrituras relacionadas, que utilizan un modelo derivado de TIS-620 .
Referencias
- ^ a b c d INFORME SOBRE LAS RECOMENDACIONES FINALES DEL GRUPO DE TRABAJO SOBRE TACE16 (PDF) (Informe).
- ^ a b "DOCUMENTO DE LICITACIÓN para el desarrollo de fuentes tamiles y controlador de teclado tamil para codificaciones de 16 bits (Unicode y TACE16)" (PDF) . Academia Virtual Tamil .
- ^ a b "தமிழ் எழுத்துருக்கள்" . தமிழ் இணையக் கல்விக்கழகம் ACADEMIA VIRTUAL TAMIL .
- ^ a b Orden del Gobierno de Tamil Nadu (GO), Controladores de teclado y fuentes obsoletos. Enlace archivado el 27 de diciembre de 2023 en archive.today
- ^ Academia Virtual Tamil . "Anexo 4: Secuencia de teclado extendida de máquina de escribir para Unicode y TACE16" (PDF) . Documento de licitación para el desarrollo de fuentes tamiles y controlador de teclado tamil para codificaciones de 16 bits (Unicode y TACE16) . Chennai .
- ^ a b c d "Preguntas frecuentes - Idioma y escritura tamil" . Consorcio Unicode .
- ^ a b Yergeau, F. (1998). UTF-8, un formato de transformación de ISO 10646. IETF . doi : 10.17487 /rfc2279 . RFC 2279.
- ^ "Políticas de estabilidad de la codificación de caracteres Unicode" . Consorcio Unicode.
- ^ West, Andrew (14 de septiembre de 2006). "Parte 1 del tibetano precompuesto: BrdaRten" . BabelStone .
- ^ Organismo Nacional de China (2003-10-20). "Declaración de China sobre BrdaRten ad hoc" . ISO/IEC JTC1/SC2 /WG2 N2674.
- ^ Karlsson, Kent (2 de marzo de 2000). "Comentarios sobre la propuesta de la RPDC de un nuevo elemento de trabajo sobre caracteres coreanos" . ISO/IEC JTC1/SC2 /WG2 N2167.
- ^ Cho, Chun-Hui (5 de julio de 2000). "Carta de la RPDC sobre nombres de caracteres y ordenación en 10646-1: 2000" (PDF) . ISO/IEC JTC1/SC2 /WG2 N2231.
- ^ Anantham, ARAmaithi (26 de enero de 2012). "Nuevas propuestas de codificación" (PDF) . Unicódigo .
- ^ "Archivo de notificaciones de no aprobación" . Unicode . 5 de marzo de 2012.
- ^ Annamalai, M.; Arulalan, T., Open-Tamil: Herramientas de procesamiento de texto en idioma tamil para Python v3 , consultado el 31 de diciembre de 2023
- Estándares de codificación de caracteres tamiles
- Conjuntos de caracteres