En Unicode , un alfabeto es una colección de letras y otros signos escritos que se utilizan para representar información textual en uno o más sistemas de escritura . [ 1 ] Algunos alfabetos admiten solo un sistema de escritura e idioma , por ejemplo, el armenio . Otros alfabetos admiten muchos sistemas de escritura diferentes; por ejemplo, el alfabeto latino admite inglés , francés , alemán , italiano , vietnamita , el propio latín y muchos otros idiomas. Algunos idiomas utilizan múltiples sistemas de escritura alternativos y, por lo tanto, también utilizan varios alfabetos; por ejemplo, en turco , el alfabeto árabe se utilizó antes del siglo XX, pero se pasó al latino a principios del siglo XX. Los símbolos y los caracteres de control Unicode son más o menos complementarios a los alfabetos .
Los caracteres diacríticos y de puntuación unificados suelen tener la propiedad de escritura "común" o "heredada". Sin embargo, cada escritura a menudo tiene su propia puntuación y diacríticos , de modo que muchas incluyen no solo letras, sino también diacríticos y otros signos, puntuación, números e incluso sus propios símbolos y espacios .
Unicode 17.0 define 172 escrituras distintas, incluyendo 102 escrituras modernas y 70 escrituras antiguas o históricas. [ 2 ] [ 3 ] Más escrituras están en proceso de codificación o se han asignado tentativamente para su codificación en las hojas de ruta. [ 4 ]
Definición y clasificación
Cuando varios idiomas utilizan el mismo alfabeto, suelen existir algunas diferencias, sobre todo en los diacríticos y otros signos. Por ejemplo, tanto el sueco como el inglés utilizan el alfabeto latino. Sin embargo, el sueco incluye el carácter å (a veces llamado O sueca ) , mientras que el inglés no lo tiene. Tampoco utiliza el anillo combinador diacrítico mencionado anteriormente para ningún carácter. En general, los idiomas que comparten el mismo alfabeto comparten muchos caracteres. A pesar de estas diferencias superficiales en los sistemas de escritura sueco e inglés, se dice que utilizan el mismo alfabeto latino. Por lo tanto, la abstracción de alfabetos de Unicode es una técnica de organización básica. Las diferencias entre los distintos alfabetos o sistemas de escritura persisten y se gestionan mediante los alfabetos flexibles, los signos combinadores y los algoritmos de intercalación de Unicode.
Guion versus sistema de escritura
En ocasiones, el término «sistema de escritura » se utiliza como sinónimo de «alfabeto». Sin embargo, también puede referirse al sistema de escritura específico y concreto que admite un alfabeto. Por ejemplo, el sistema de escritura vietnamita se basa en el alfabeto latino. Un sistema de escritura también puede abarcar más de un alfabeto; por ejemplo, el sistema de escritura japonés utiliza los alfabetos kanji , hiragana y katakana .
La mayoría de los sistemas de escritura se pueden dividir a grandes rasgos en varias categorías: logográficos , silábicos , alfabéticos (o segmentales ), abugida , abjad y facéticos ; sin embargo, todas las características de cualquiera de estas categorías pueden encontrarse en un sistema de escritura dado en proporciones variables, lo que a menudo dificulta su categorización precisa. El término sistema complejo se utiliza a veces para describir aquellos en los que la mezcla de características dificulta la clasificación.
Unicode admite todos estos sistemas de escritura mediante sus numerosos alfabetos. Además, Unicode añade propiedades adicionales a los caracteres para diferenciarlos y determinar su comportamiento dentro de los algoritmos de procesamiento de texto de Unicode.
Valores de propiedades de script especiales
Además de las propiedades de escritura explícitas o específicas, Unicode utiliza tres valores especiales: [ 5 ]
- Común
- Unicode solo puede asignar un carácter del UCS a un único sistema de escritura. Sin embargo, muchos caracteres —aquellos que no forman parte de un sistema de escritura formal en lengua natural o que están unificados en varios sistemas de escritura— pueden usarse en más de un sistema de escritura (por ejemplo, símbolos monetarios, números y signos de puntuación). En estos casos, Unicode los define como pertenecientes al sistema de escritura "común" ( código ISO 15924 "Zyyy").
- Heredado
- Muchos diacríticos y caracteres combinables sin espaciado pueden aplicarse a caracteres de más de un alfabeto. En estos casos, Unicode los asigna al alfabeto "heredado" (código ISO 15924 Zinh), lo que significa que tienen la misma clase de alfabeto que el carácter base con el que se combinan, por lo que en diferentes contextos pueden tratarse como pertenecientes a distintos alfabetos. Por ejemplo, U+0308 ◌ ̈ DIÉRESIS COMBINABLE puede combinarse con U+0065 e LETRA MINÚSCULA LATINA E para crear una ë latina o con U+0435 е LETRA MINÚSCULA CIRÍLICA IE para la ё cirílica . En el primer caso, hereda el alfabeto latino del carácter base, mientras que en el segundo caso, hereda el alfabeto cirílico del carácter base.
- Desconocido
- El valor de script "desconocido" (código ISO 15924 Zzzz) se asigna a los puntos de código no asignados, de uso privado, que no son caracteres y son sustitutos.
Categorías de personajes dentro de los guiones
Unicode proporciona una propiedad de categoría general para cada carácter. Así, además de pertenecer a un alfabeto, cada carácter tiene una categoría general. Normalmente, los alfabetos incluyen caracteres como mayúsculas, minúsculas y modificadores. Algunos caracteres se consideran letras de título para ciertas ligaduras precompuestas , como Dz (U+01F2). Estas ligaduras de título se encuentran en los alfabetos latino y griego y son caracteres de compatibilidad ; por lo tanto, Unicode desaconseja su uso. Es improbable que se añadan nuevas letras de título en el futuro.
La mayoría de los sistemas de escritura no distinguen entre mayúsculas y minúsculas. En estos sistemas, todas las letras se clasifican como "otras letras" o "letras modificadoras". Los ideogramas, como los de Unihan, también se clasifican como "otras letras". Sin embargo, algunos sistemas sí distinguen entre mayúsculas y minúsculas: el latín, el cirílico, el griego, el armenio, el georgiano y el deseret. Incluso en estos sistemas, existen algunas letras que no son ni mayúsculas ni minúsculas.
Los sistemas de escritura también pueden contener caracteres de categorías generales, como marcas (diacríticas y de otro tipo), números , signos de puntuación , separadores (como espacios), símbolos y caracteres de formato no gráficos . Estos se incluyen en un sistema de escritura particular cuando son exclusivos de ese sistema. Otros caracteres de este tipo suelen estar unificados e incluidos en los bloques de puntuación o diacríticos. Sin embargo, la mayoría de los caracteres en cualquier sistema de escritura (excepto los sistemas comunes y heredados) son letras.
Lista de scripts codificados
A partir de la versión 17.0Unicode define 175 alias de escritura ("alias de valor de propiedad") para los códigos de la lista ISO 15924. Unicode asigna el alias "Común" al Zyyycódigo ISO 15924 para escrituras no determinadas, "Heredado" al código ISO 15924 Zinhpara escrituras heredadas y "Desconocido" al código ISO 15924 Zzzzpara escrituras no codificadas. Existen códigos de escritura definidos por ISO 15924 que no se utilizan en Unicode, incluidos Zsym(Símbolos) y Zmth(Notación matemática).
Scripts faltantes en Unicode
El proyecto Missing Scripts —con colaboradores de la Universidad de Ciencias Aplicadas de Maguncia , el L'Atelier national de recherche typographique (ANRT) de Nancy y la Universidad de California, Berkeley— ha compilado una lista de 131 escrituras que aún no han sido codificadas en el estándar Unicode , de un total de 294 escrituras reconocidas según el estado actual de la investigación. [ 6 ]
Véase también
Referencias
- ↑ "Glosario" . unicode.org .
- ↑ "Base de datos de caracteres Unicode: escrituras" . unicode.org .
- ↑ "Scripts compatibles" . unicode.org .
- ↑ https://www.unicode.org/roadmaps/ Hojas de ruta hacia Unicode
- ↑ "UAX #24: Propiedad de escritura Unicode" . www.unicode.org .
- ↑ "Los sistemas de escritura del mundo" . www.worldswritingsystems.org . Consultado el 4 de octubre de 2024 .
Enlaces externos
- Iniciativa de Codificación de Sistemas de Escritura , un proyecto de la Universidad de California en Berkeley, EE. UU., que trabaja para incluir más sistemas de escritura en el estándar Unicode.
- Los sistemas de escritura del mundo : una descripción general de los 294 sistemas de escritura conocidos, cada uno con un glifo de referencia tipográfica y su estado Unicode.
- Unicode