Articulo de referencia

Avión (Unicode)

En el estándar Unicode , un plano es un grupo contiguo de 65,536 (2 16 ) puntos de código . Hay 17 planos, identificados por los números del 0 al 16, que corresponden a los posi...

En el estándar Unicode , un plano es un grupo contiguo de 65,536 (2 16 ) puntos de código . Hay 17 planos, identificados por los números del 0 al 16, que corresponden a los posibles valores 00–10 16 de las dos primeras posiciones en formato hexadecimal de seis posiciones ( U+hhhhhh ). El plano 0 es el Plano Multilingüe Básico (BMP), que contiene los caracteres más utilizados. Los planos superiores del 1 al 16 se denominan "planos suplementarios". [ 1 ] El último punto de código en Unicode es el último punto de código en el plano 16, U+10FFFF. A partir de la versión 17.0 de Unicode , cinco de los planos tienen puntos de código (caracteres) asignados y siete tienen nombre.

El límite de 17 planos se debe a UTF-16 , que puede codificar 2²⁰ puntos de código (16 planos) como pares de palabras , más el BMP como una sola palabra. [ 2 ] UTF-8 fue diseñado con un límite mucho mayor de 2³¹ (2.147.483.648) puntos de código (32.768 planos), y aún podría codificar 2²¹ ( 2.097.152) puntos de código (32 planos) incluso bajo el límite actual de 4 bytes . [ 3 ]

Los 17 planos pueden albergar 1.114.112 puntos de código. De estos, 2.048 son caracteres sustitutos (utilizados para formar pares en UTF-16), 66 no son caracteres y 137.468 están reservados para uso privado , quedando 974.530 para asignación pública.

Los planos se subdividen a su vez en bloques Unicode , que, a diferencia de los planos, no tienen un tamaño fijo. Los 346 bloques definidos en Unicode 17.0 cubren el 27 % del espacio de puntos de código posible y varían en tamaño desde un mínimo de 16 puntos de código (dieciséis bloques) hasta un máximo de 65 536 puntos de código (Área de Uso Privado Suplementario A y B, que constituyen la totalidad de los planos 15 y 16). Para su uso futuro, se han trazado tentativamente rangos de caracteres para la mayoría de los sistemas de escritura conocidos, tanto actuales como antiguos. [ 4 ]

Descripción general

Plano multilingüe básico

Mapa del Plano Multilingüe Básico. Cada casilla numerada representa 256 puntos de código.

El primer plano, el plano 0 , denominado Plano Multilingüe Básico ( BMP ), contiene caracteres para casi todos los idiomas modernos y una gran cantidad de símbolos . Un objetivo primordial del BMP es facilitar la unificación de conjuntos de caracteres previos, así como la incorporación de caracteres para la escritura . La mayoría de los puntos de código asignados en el BMP se utilizan para codificar caracteres chinos, japoneses y coreanos ( CJK ), así como caracteres de otros sistemas de escritura de Asia Oriental.

Los códigos High Surrogate (U+D800–U+DBFF) y Low Surrogate (U+DC00–U+DFFF) están reservados para codificar caracteres que no son BMP en UTF-16 mediante un par de códigos de 16 bits : uno High Surrogate y otro Low Surrogate. A un único punto de código subrogate nunca se le asignará un carácter.

De los 65.536 puntos de código en este plano, 65.520 se han asignado a un bloque Unicode, quedando 16 puntos de código en un único rango no asignado (2FE0..2FEF).

A partir de Unicode 17.0El BMP comprende los siguientes 164 bloques:

Plano multilingüe suplementario

Mapa del Plano Multilingüe Suplementario. Cada casilla numerada representa 256 puntos de código.

El plano 1 , el Plano Multilingüe Suplementario ( PMS ), contiene escrituras históricas (excepto la ideográfica CJK), y símbolos y notación utilizados en ciertos campos. Las escrituras incluyen Lineal B , jeroglíficos egipcios y escritura cuneiforme . También incluye ortografías de la reforma inglesa como Shavian y Deseret , y algunas escrituras modernas como Osage , Warang Citi , Adlam , Wancho y Toto . Los símbolos y notaciones incluyen notación musical histórica y moderna ; alfanuméricos matemáticos ; taquigrafía; emojis y otros conjuntos pictográficos; y símbolos de juegos para naipes , mahjong y dominó .

A partir de Unicode 17.0El SMP comprende los siguientes 168 bloques:

Plano ideográfico suplementario

Mapa del Plano Ideográfico Suplementario. Cada casilla numerada representa 256 puntos de código.

El plano 2 , el plano ideográfico suplementario ( SIP ), se utiliza para los ideogramas CJK, principalmente los ideogramas unificados CJK , que no estaban incluidos en los estándares de codificación de caracteres anteriores.

A partir de Unicode 17.0El SIP consta de los siguientes siete bloques:

Plano ideográfico terciario

Mapa del Plano Ideográfico Terciario. Cada casilla numerada representa 256 puntos de código.

El plano 3 es el Plano Ideográfico Terciario (TIP). La extensión G de los ideogramas unificados CJK se añadió al TIP en Unicode 13.0, publicado en marzo de 2020. [ 5 ] También se le ha asignado provisionalmente la escritura de sello pequeño . [ 6 ]

A partir de Unicode 17.0El TIP comprende los siguientes tres bloques:

Aviones no asignados

Planos 4 a 13 (planos 4 a D en hexadecimal ): Aún no se han asignado caracteres, ni se ha propuesto su asignación, a los planos 4 a 13.

Avión suplementario de propósito especial

Mapa del Plano Especial Suplementario. Cada casilla numerada representa 256 puntos de código.

El plano 14 ( E en hexadecimal ) se denomina plano suplementario de propósito especial ( SSP ). Comprende los dos bloques siguientes , según Unicode 17.0.:

Planos de la zona de uso privado

Los planos 15 y 16 ( F y 10 en hexadecimal ) contienen cada uno un " Área de Uso Privado ". Estos contienen bloques denominados Área de Uso Privado Suplementaria-A ( PUA-A ) y -B ( PUA-B ). Las Áreas de Uso Privado están disponibles para su uso por terceros ajenos a ISO y Unicode (codificación de caracteres de uso privado).

Notas

  1. Puntos de código que se han asignado a un bloque Unicode .

Referencias

  1. "Glosario" . Unicode . Consultado el 27 de septiembre de 2021 .
  2. "El estándar Unicode versión 6.0 – Especificación principal" (PDF) . El Consorcio Unicode. Febrero de 2011. Tabla 3.5 "Distribución de bits UTF-16".
  3. "El estándar Unicode versión 6.0 – Especificación principal" (PDF) . El Consorcio Unicode. Febrero de 2011. Tabla 3.6 "Distribución de bits UTF-8".
  4. "Hojas de ruta hacia Unicode" . Unicode . Consultado el 27 de septiembre de 2021 .
  5. "Anuncio del estándar Unicode, versión 13.0" . El blog de Unicode . 10 de marzo de 2020.
  6. "Nuevos caracteres propuestos: El proceso de desarrollo" . www.unicode.org .