La codificación de todos los caracteres tamiles ( TACE16 ) es un esquema para codificar la escritura tamil en el Área de Uso Privado de Unicode , que implementa un modelo de caracteres basado en silabarios que difiere del modelo ISCII modificado utilizado por la implementación tamil existente de Unicode . [ 1 ] [ 2 ]
Controladores de teclado y fuentes
El controlador de teclado para este esquema de codificación está disponible gratuitamente en el sitio web de la Academia Virtual Tamil . [ 3 ] [ 4 ] Utiliza los diseños de teclado Tamil 99 y Tamil Typewriter , aprobados por el Gobierno de Tamil Nadu , y asigna las pulsaciones de teclas de entrada a sus caracteres correspondientes del esquema TACE16. [ 2 ] Para leer archivos creados con TACE16, las fuentes Unicode Tamil correspondientes también están disponibles en el mismo sitio web. [ 3 ] [ 4 ] Estas fuentes asignan glifos para caracteres del formato TACE16, pero también para el bloque Unicode para caracteres ASCII y Tamil , de modo que pueden proporcionar compatibilidad con versiones anteriores para leer archivos existentes que se crean utilizando el bloque Unicode Tamil .
Conjunto de caracteres
Todos los caracteres de este esquema de codificación se encuentran en el área de uso privado del Plano Multilingüe Básico del Conjunto de Caracteres Codificados Universales de Unicode .
Comparison of TACE16 to present Tamil Unicode
Criticism of the standard Unicode character model for Tamil

The existing Unicode character model for Tamil is, like most of Indic Unicode,[b] an abugida-based model derived from ISCII. It been criticized for several reasons.[1]
Unicode represents only 31 Tamil base characters as single code points, out of 247 grapheme clusters. These include stand-alone vowels, and 23 basic consonant glyphs (which, due to not bearing a virama, nonetheless denote a syllable with both a consonant and a vowel when used on their own). The others are represented as sequences of code points, requiring software support for advanced typography features (such as Apple Advanced Typography, Graphite, or OpenType advanced typography) to render correctly. This also requires the use of invisible zero-width joiner and zero-width non-joiner characters in places where the desired grapheme cluster would otherwise be ambiguous. This complexity can result in security vulnerabilities and ambiguous combinations, can require the use of an exception table to forbid invalid combinations of code points, and can necessitate the use of string normalization to compare two strings for equality.
Additionally, since syllables with both a consonant and a vowel make up 64 to 70% of Tamil text, an abugida-based model which encodes the consonant and vowel parts as separate code points is inefficient, in terms of how long a string needs to be to contain a given piece of text, in comparison with a syllabary-based model.
Además, ISCII es principalmente una codificación de Devanagari , y las codificaciones ISCII de otras escrituras bráhmicas (incluido el tamil) codifican caracteres sobre los puntos de código de los caracteres correspondientes en Devanagari ISCII. Aunque Unicode codifica las escrituras bráhmicas por separado, el bloque de tamil refleja la disposición ISCII (con un orden de caracteres al estilo de Devanagari y espacio reservado en las posiciones correspondientes a caracteres devanagari sin equivalente en tamil); por consiguiente, los caracteres no están en el orden de secuencia natural, y las cadenas ordenadas por punto de código (análogas a la ordenación " ASCIIbetical " del texto en inglés) no producirán el orden de ordenación esperado. Se requiere un algoritmo de ordenación complejo para organizarlos en el orden natural.
TACE16 en comparación
Los siguientes datos proporcionan una comparación del Unicode Tamil actual frente a TACE16 en materia de gobierno electrónico y navegación: [ 1 ]
- TACE16 es entre un 5,46 y un 11,94 por ciento más eficiente que Unicode Tamil para el almacenamiento de datos .
- TACE16 es entre un 18,69 y un 22,99 por ciento más eficiente que Unicode Tamil para la clasificación de datos de índice.
- TACE16 es un 25,39 % más eficiente que Unicode Tamil cuando todos los datos están en tamil. La secuencia de intercalación predeterminada (binaria) que se sigue al usar los valores del espacio de códigos en TACE16 no se ajusta al orden del diccionario tamil.
- TACE16 es más rápido en la clasificación que Unicode Tamil, con una diferencia de entre el 0,31 y el 16,96 por ciento.
- La creación de índices en datos TACE16 es un 36,7 % más rápida que en Unicode.
- Para la búsqueda por clave completa en campos indexados, TACE16 ofrece un rendimiento superior al de Unicode Tamil hasta en un 24,07 %. En el caso de campos no indexados, TACE16 ofrece un rendimiento superior al de Unicode Tamil hasta en un 20,9 %.
- La representación de datos estáticos en tamil funciona con TACE16.
TACE16 ofrece mejoras de rendimiento en tiempo y espacio de procesamiento. Abarca todo el texto general en tamil; es secuencial; y es inequívoco, ya que cada punto corresponde a un solo carácter. [ 1 ] El sistema TACE16 requiere menos ciclos de instrucción que Unicode Tamil, y también permite la programación basada en la gramática tamil , que requiere un desarrollo de marco adicional en Unicode Tamil.
Respuestas del Consorcio Unicode
The Unicode Consortium publishes a dedicated FAQ page on the Tamil script which responds to some of the criticisms. In defence of the ISCII model, the Consortium notes that expert linguists, typographers and programmers were involved in its development, but acknowledges that compromises were made due to ISCII being constrained to single-byte extended ASCII. The Consortium points out that Unicode Tamil is now implemented by all major operating systems and web browsers, and maintains that it should be used in open interchange contexts, such as online, since tools such as search engines would not necessarily be able to identify or interpret a sequence of Unicode private-use code points as Tamil text. However, the Consortium does not object to the use of Private-Use Area schemes, including TACE16, internally to particular processes for which they are useful. In particular, it highlights that both markup schemes and alternative encoding schemes may be used by researchers for specialised purposes such as natural-language processing.[6]
Unicode defines normative named-sequences for all Tamil pure consonants and syllables which are represented with sequences of more than one code point, and a dedicated table is published as part of the Unicode Standard listing all of these sequences, in their traditional order, along with their correct glyphs. The Consortium points out that it has been open to accepting proposals for characters for which no existing Unicode representation exists: for example, adding several historical fractions and other symbols as the Tamil Supplement block in version 12.0 in 2019.[6]
Regarding collation, the Consortium argues that obtaining the correct result from sorting by code point is the exception rather than the rule, highlighting that, in unmodified ASCIIbetical ordering, the uppercase Latin letter Z sorts before the lowercase letter a, and also highlighting that collation rules often differ by language (see e.g. ö). Regarding space efficiency, the Consortium argues that storage space and bandwidth taken up by text is usually far overshadowed by other accompanying media such as images and video, and that text content performs well under general-purpose compression methods such as Deflate (originally from the ZIP file format, standardized in RFC 1951 and integrated in the HTTP protocol as a generic encoding scheme).[6]
Unicode Stability Policy
Cuando se publicó por primera vez (versión 1.0.0), Unicode solo ofrecía garantías de estabilidad limitadas. Por ello, el bloque tibetano original se eliminó en la versión 1.0.1 (y su espacio ha sido ocupado desde entonces por el bloque birmano ), y el bloque original para sílabas coreanas se eliminó en la versión 2.0 (y ahora está ocupado por la Extensión A de Ideogramas Unificados CJK ). Tanto el bloque actual de Sílabas Hangul para sílabas coreanas como el bloque tibetano actual datan de Unicode 2.0. Esto se hizo bajo el supuesto de que existía poco o ningún contenido existente que utilizara Unicode para esos sistemas de escritura, [ 7 ] ya que rompería la compatibilidad con todo el contenido Unicode existente y los métodos de entrada para esos sistemas de escritura. Después de este llamado "caos coreano", los comités responsables se comprometieron a no volver a realizar un cambio que rompiera la compatibilidad, [ 7 ] lo que ahora forma parte de la Política de Estabilidad de Unicode. [ 8 ]
Esta política de estabilidad se ha mantenido desde entonces, a pesar de las demandas de volver a codificar o cambiar el modelo de caracteres tanto para el tibetano como para el coreano por segunda vez, hechas por China y Corea del Norte respectivamente. [ 9 ] [ 10 ] [ 11 ] [ 12 ] De igual modo en relación con el tamil, el Consorcio enfatiza la "cuestión crucial de mantener la estabilidad del estándar para las implementaciones existentes" y argumenta que "los costos y el impacto resultantes de desestabilizar el estándar" superarían sustancialmente cualquier beneficio de eficiencia en velocidad de procesamiento o espacio de almacenamiento. [ 6 ]
Hubo una propuesta para recodificar el tamil [ 13 ] que fue rechazada por Unicode, que dijo que la recodificación sería perjudicial y que no había evidencia convincente de que la codificación del tamil de Unicode fuera deficiente. [ 14 ]
Alternativas
Tamil abierto
El proyecto Open-Tamil [ 15 ] proporciona muchas de las operaciones comunes. Afirma cumplir con el Nivel 1 de procesamiento de texto tamil sin usar TACE16, pero está escrito sobre una lógica de programación adicional que se necesita para el tamil Unicode.
Véase también
- Código de escritura tamil para el intercambio de información
- teclado tamil
- தமிழ் 99
- InScript
- Tamil (bloque Unicode)
- Blogosfera tamil
- AnyTaFont2UTF8 : un proyecto de código abierto para todos los caracteres de codificación/mapeo de fuentes tamil.
Notas a pie de página
- ↑ Los silabogramas resaltados en las columnas U y Ū son aquellos en los que la parte vocálica del glifo no coincide ni con las formas de subunión simples que se muestran para aquellos que combinan marcas vocálicas en la tabla de bloques Unicode, ni con las formas de unión derecha de Grantha (como las que se utilizan para aquellos que combinan marcas vocálicas de forma aislada, por ejemplo, en las fuentes Noto ).
- ↑ Excepto para el tibetano , que utiliza un modelo diferente, y para el tailandés y escrituras relacionadas, que utilizan un modelo derivado de TIS-620 .
Referencias
- 1 2 3 4 INFORME SOBRE LAS RECOMENDACIONES FINALES DEL GRUPO DE TRABAJO SOBRE TACE16 (PDF) (Informe).
- 1 2 "DOCUMENTO DE LICITACIÓN para el desarrollo de fuentes tamiles y controlador de teclado tamil para codificaciones de 16 bits (Unicode y TACE16)" (PDF) . Academia Virtual Tamil .
- ^ " தமிழ் எழுத்துருக்கள்" . தமிழ் இணையக் கல்விக்கழகம் ACADEMIA VIRTUAL TAMIL .
- 1 2 Orden del Gobierno de Tamil Nadu (GO), Controladores de teclado y fuentes obsoletas. Enlace archivado el 27 de diciembre de 2023 en archive.today
- ↑ Academia Virtual Tamil . "Anexo 4: Secuencia de teclado extendida de máquina de escribir para Unicode y TACE16" (PDF) . Documento de licitación para el desarrollo de fuentes tamiles y controlador de teclado tamil para codificaciones de 16 bits (Unicode y TACE16) . Chennai .
- 1 2 3 4 "Preguntas frecuentes - Idioma y escritura tamil" . Consorcio Unicode .
- 1 2 Yergeau, F. (1998). UTF-8, un formato de transformación de ISO 10646. IETF . doi : 10.17487 /rfc2279 . RFC 2279.
- ↑ "Políticas de estabilidad de la codificación de caracteres Unicode" . Consorcio Unicode.
- ↑ West, Andrew (14 de septiembre de 2006). "Parte 1 del tibetano precompuesto : BrdaRten" . BabelStone .
- ↑ Organismo Nacional de China (2003-10-20). "Declaración de China sobre BrdaRten ad hoc" . ISO/IEC JTC1/SC2 /WG2 N2674.
- ↑ Karlsson, Kent (2000-03-02). "Comentarios sobre la propuesta de la RPDC de un nuevo elemento de trabajo sobre caracteres coreanos" . ISO/IEC JTC1/SC2 /WG2 N2167.
- ↑ Cho, Chun-Hui (5 de julio de 2000). "Carta de la RPDC sobre nombres de caracteres y ordenación en 10646-1: 2000" (PDF) . ISO/IEC JTC1/SC2 /WG2 N2231.
- ^ Anantham, ARAmaithi (26 de enero de 2012). "Nuevas propuestas de codificación" (PDF) . Unicódigo .
- ↑ "Archivo de notificaciones de no aprobación" . Unicode . 5 de marzo de 2012.
- ↑ Annamalai, M.; Arulalan, T., Open-Tamil: Herramientas de procesamiento de texto en idioma tamil para Python v3 , consultado el 31 de diciembre de 2023
- Estándares de codificación de caracteres tamiles
- Conjuntos de caracteres