Un bloque Unicode es uno de los rangos contiguos de códigos de caracteres numéricos ( puntos de código ) del conjunto de caracteres Unicode , definidos por el Consorcio Unicode con fines administrativos y de documentación. Por lo general, las propuestas, como la adición de nuevos glifos, se discuten y evalúan considerando el bloque o bloques correspondientes en su conjunto.
Por lo general, aunque no siempre, cada bloque está destinado a proporcionar glifos utilizados por uno o más idiomas específicos, o en algún área de aplicación general como matemáticas , topografía , composición tipográfica decorativa , foros sociales, etc.
Diseño e implementación
Los bloques Unicode se identifican mediante nombres únicos, que utilizan únicamente caracteres ASCII y suelen describir la naturaleza de los símbolos, en inglés ; por ejemplo, "Tibetan" o "Supplemental Arrows-A". Al comparar nombres de bloques, se supone que se deben equiparar las letras mayúsculas con las minúsculas e ignorar los espacios en blanco, los guiones y las barras bajas; por lo tanto, el último nombre es equivalente a "supplemental_arrows_a", "SupplementalArrowsA" y "SUPPLEMENTALARROWSA". [ 1 ]
Los bloques son disjuntos por pares ; es decir, no se superponen. El punto de código inicial y el tamaño (número de puntos de código) de cada bloque son siempre múltiplos de 16; por lo tanto, en notación hexadecimal , el punto inicial (más pequeño) es U+ xxx 0 y el punto final (más grande) es U+ yyy F, donde xxx e yyy son tres o más dígitos hexadecimales. (Estas restricciones tienen como objetivo simplificar la visualización de glifos en documentos del Consorcio Unicode, como tablas con 16 filas etiquetadas con el último dígito hexadecimal del punto de código. [ 1 ] ) El tamaño de un bloque puede variar desde un mínimo de 16 hasta un máximo de 65 536 puntos de código.
Cada punto de código asignado tiene una propiedad de glifo llamada "Bloque", cuyo valor es una cadena de caracteres que nombra el bloque único al que pertenece ese punto. [ 2 ] Sin embargo, un bloque también puede contener puntos de código no asignados, generalmente reservados para futuras adiciones de caracteres que "lógicamente" deberían pertenecer a ese bloque. Los puntos de código que no pertenecen a ninguno de los bloques nombrados, por ejemplo, en los planos no asignados 4-13, tienen el valor block="No_Bloque". [ 1 ]
El mero hecho de pertenecer a un bloque Unicode específico no garantiza ninguna propiedad particular de los caracteres que se espera que contenga o que pueda contener en el futuro. La identidad de cualquier carácter se determina por sus propiedades indicadas en la base de datos de caracteres Unicode. Por ejemplo, el rango contiguo de 32 puntos de código no caracteres U+FDD0..U+FDEF no comparte ninguna de las propiedades comunes a los demás caracteres del bloque Formas de presentación árabe-A , es decir, no son caracteres de escritura árabe ni "no caracteres de derecha a izquierda", y se asignan allí como relleno para este bloque dado que se ha acordado que no se codificarán más caracteres de compatibilidad árabe. [ 3 ]
Otras clasificaciones
Cada punto Unicode también posee una propiedad denominada " Categoría General ", que intenta describir la función del símbolo correspondiente en los idiomas o aplicaciones para los que fue incluido en el sistema. Ejemplos de Categorías Generales son "Lu" (que significa letra mayúscula), "Nd" (dígito decimal), "Pi" (signo de puntuación de comillas abiertas) y "Mn" (signo diacrítico que no indica espacio, es decir, un glifo precedente). Esta división es completamente independiente de los bloques de código: los puntos de código con una Categoría General determinada generalmente abarcan varios bloques y no tienen por qué ser consecutivos, ni siquiera dentro de cada bloque. [ 4 ]
Cada punto de código también tiene una propiedad de script que especifica para qué sistema de escritura está destinado, o si está destinado a varios sistemas de escritura. Esto también es independiente del bloque.
En las descripciones del sistema Unicode, un bloque puede subdividirse en subgrupos más específicos, como los " Símbolos de ajedrez " en el bloque de Símbolos varios (que no debe confundirse con el bloque independiente de Símbolos de ajedrez ). Estos subgrupos no son "bloques" en el sentido técnico que utiliza el consorcio Unicode, y se denominan así únicamente para facilitar la comprensión a los usuarios.
Lista de bloques
Unicode 17.0 define 346 bloques: [ 1 ]
- 164 en el plano 0, el Plano Multilingüe Básico (en la tabla siguiente: § BMP )
- 168 en el plano 1, el Plano Multilingüe Suplementario ( § SMP )
- 7 en el plano 2, el Plano Ideográfico Suplementario ( § SIP )
- 3 en el plano 3, el Plano Ideográfico Terciario ( § TIP )
- 2 en el plano 14 (E en hexadecimal ), el Plano Especial Suplementario ( § SSP )
- Una en cada uno de los planos 15 (F hex ) y 16 (10 hex ), denominadas Área de Uso Privado Suplementario-A y -B ( § PUA-A ).
Bloques movidos
La Política de Estabilidad de Unicode exige que un carácter, una vez asignado, no pueda ser movido ni eliminado, aunque sí puede ser declarado obsoleto. Esto se aplica a Unicode 2.0 y a todas las versiones posteriores.
Anteriormente, se trasladaron los siguientes bloques:
Referencias
- 1 2 3 4 "Archivo de datos de bloques Unicode, versión Unicode 17.0" . Consorcio Unicode . Consultado el 6 de noviembre de 2025 .
- ↑ "Glosario" . www.unicode.org . Consultado el 7 de agosto de 2022 .
- ↑ "Preguntas frecuentes sobre caracteres, no caracteres y centinelas de uso privado" . www.unicode.org . Consultado el 24 de julio de 2023 .
- ↑ "Especificación básica de Unicode, capítulo 4: propiedades de los caracteres" (PDF) . Consultado el 15 de septiembre de 2021 .
- ↑ "3.8: Tablas bloque por bloque" (PDF) . El estándar Unicode . Versión 1.0. Consorcio Unicode .
- 1 2 3 "Apéndice E: Nombres de bloques" (PDF) . El estándar Unicode . Versión 1.1. Consorcio Unicode .
Enlaces externos
- Sitio web oficial del Consorcio Unicode(en inglés)
- bloques Unicode