El Código de Escritura Indio para el Intercambio de Información ( ISCII ) es un esquema de codificación para representar diversos sistemas de escritura de la India . Codifica las principales escrituras índicas y una transliteración romana. Las escrituras compatibles son: bengalí-asamés , devanagari , gujarati , gurmukhi , kannada , malayalam , odia , tamil y telugu . ISCII no codifica los sistemas de escritura de la India basados en el persa , pero sus códigos de conmutación de sistemas de escritura permiten incluir el cachemir , el sindhi , el urdu , el persa , el pastún y el árabe . Los sistemas de escritura basados en el persa se codificaron posteriormente en el sistema PASCII .
ISCII no se ha utilizado ampliamente fuera de ciertas instituciones gubernamentales, aunque se usó una variante sin el mecanismo ATR en Mac OS clásico , Mac OS Devanagari , [ 1 ] y ahora ha sido prácticamente obsoleto por Unicode . Unicode usa un bloque separado para cada sistema de escritura índico y conserva en gran medida la disposición ISCII dentro de cada bloque. [ 2 ] : 462
Fondo
Los sistemas de escritura derivados del Brahmi tienen una estructura similar. [ 2 ] : 462 Así, ISCII codifica letras con el mismo valor fonético en el mismo punto de código, superponiéndose a las distintas escrituras. Por ejemplo, los códigos ISCII 0xB3 0xDB representan [ki]. Esto se representará como കി en malayalam , कि en devanagari, como ਕਿ en gurmukhi y como கி en tamil. El sistema de escritura se puede seleccionar en texto enriquecido mediante marcado o en texto plano mediante el código ATR que se describe a continuación.
Una motivación para el uso de una única codificación es la idea de que permitirá una fácil transliteración de un sistema de escritura a otro. [ 2 ] : 462 Sin embargo, existen suficientes incompatibilidades como para que esta no sea una idea realmente práctica.
ISCII es una codificación de 8 bits. [ 3 ] : 4 Los 128 puntos de código inferiores son ASCII simples , los 128 puntos de código superiores son específicos de ISCII. Además de los puntos de código que representan caracteres, ISCII utiliza un punto de código con el mnemónico ATR que indica que el siguiente byte contiene uno de dos tipos de información. Un conjunto de valores cambia el sistema de escritura hasta el siguiente indicador de sistema de escritura o el final de línea. Otro conjunto de valores selecciona modos de visualización como negrita y cursiva. ISCII no proporciona un medio para indicar el sistema de escritura predeterminado.
Diseño de página de código
La siguiente tabla muestra el conjunto de caracteres para Devanagari . Los conjuntos de códigos para asamés, bengalí, gujarati, gurmukhi, kannada, malayalam, oriya, tamil y telugu son similares, con cada forma devanagari reemplazada por la forma equivalente en cada sistema de escritura [ 2 ] : 462 . Cada carácter se muestra con su código decimal y su equivalente Unicode .
Puntos de código especiales
- Carácter INV—punto de código D9 (217)
- El carácter INV (consonante invisible) se utiliza como una pseudoconsonante para mostrar elementos combinados de forma aislada. Por ejemplo, क (ka) + ् (halant) + INV = क् (media ka). El equivalente Unicode es U+200D ZERO WIDTH JOINER ( ZWJ ). Sin embargo, como se indica más adelante , el carácter halant de ISCII se puede duplicar o combinar con el nukta de ISCII para lograr efectos creados por ZWNJ o ZWJ en Unicode. Por esta razón, Apple asigna el carácter INV de ISCII a la marca de izquierda a derecha de Unicode , para garantizar la conversión bidireccional . [ 1 ]
- Carácter ATR—punto de código EF (239)
- El carácter ATR (atributo) seguido de un código de bytes se utiliza para cambiar a un atributo de fuente diferente (como negrita) o a un idioma ISCII o PASCII diferente (como bengalí), hasta la siguiente secuencia ATR o el final de la línea. Esto no tiene un equivalente directo en Unicode, ya que los atributos de fuente no forman parte de Unicode y cada sistema de escritura tiene un conjunto distinto de puntos de código.
- Carácter EXT—punto de código F0 (240)
- El carácter EXT (extensiones para el alfabeto védico) seguido de un código de bytes indica un acento védico. Esto no tiene un equivalente directo en Unicode, ya que los acentos védicos se asignan a puntos de código distintos.
- Carácter Halant ्—punto de código E8 (232)
- El carácter halant elimina la vocal implícita de una consonante y se usa entre consonantes para representar consonantes conjuntas. Por ejemplo, क (ka) + ् (halant) + त (ta) = क्त (kta). La secuencia ् (halant) + ् (halant) muestra una conjunción con un halant explícito, por ejemplo क (ka) + ् (halant) + ् (halant) + त (ta) = क्त. La secuencia ् (halant) + ़ (nukta) muestra una conjunción con semiconsonantes, si están disponibles, por ejemplo क (ka) + ् (halant) + ़ (nukta) + त (ta) = क्त.
- Carácter Nukta ़—punto de código E9 (233)
- El carácter nukta, que aparece después de otro carácter ISCII, se utiliza para algunos caracteres menos comunes que no existen en el conjunto ISCII principal. Por ejemplo, क (ka) + ़ (nukta) = क़ (qa). Estos caracteres tienen formas precompuestas en Unicode, como se muestra en la siguiente tabla.
Páginas de códigos para la conversión ISCII
Para convertir de Unicode (UTF-8) a una codificación ISCII/ANSI, se pueden utilizar las siguientes páginas de códigos:
- 57002: Devanagari (hindi, marathi, sánscrito, konkani)
- 57003: Bengalí
- 57004: Tamil
- 57005: Telugu
- 57006: Asamés
- 57007: Odia
- 57008: Kannada
- 57009: Malayalam
- 57010: Gujarati
- 57011: Punjabi (Gurmukhi)
Puntos de código para todos los lenguajes
Referencias
- 1 2 Apple (2005-04-05) [1998-02-05]. "Mapa (versión externa) de la codificación Devanagari de Mac OS a Unicode 2.1 y posterior" . Consorcio Unicode .
- 1 2 3 4 El estándar Unicode v15.0 Capítulo 12 (PDF) . El Consorcio Unicode . Consultado el 13 de agosto de 2024 .
- 1 2 3 4 5 IS13194:1991 (Copia digital) (PDF) . Oficina de Normas de la India. 1999.
- ↑
Enlaces externos
- Convertidores de/a ISCII a/desde diversas fuentes
- Padma – Extensión de Mozilla para transformar ISCII a Unicode. Archivada el 1 de octubre de 2019 en Wayback Machine.
- Padma – Transformador de ISCII a Unicode para telugu
- Script PHP para convertir ISCII a Unicode y viceversa.
- computación índica
- Conjuntos de caracteres
- Ortografía indostaní