Articulo de referencia

Números en Unicode

Un numeral (a menudo llamado número en Unicode ) es un carácter que denota un número. Los dígitos decimales del 0 al 9 se utilizan ampliamente en diversos sistemas de escritura ...

Un numeral (a menudo llamado número en Unicode ) es un carácter que denota un número. Los dígitos decimales del 0 al 9 se utilizan ampliamente en diversos sistemas de escritura en todo el mundo; sin embargo, los grafemas que representan los dígitos decimales varían considerablemente. Por lo tanto, Unicode incluye 22 conjuntos diferentes de grafemas para los dígitos decimales, así como varios puntos decimales, separadores de miles, signos negativos, etc. Unicode también incluye varios numerales no decimales, como los numerales egeos , los numerales romanos , los numerales de varillas de conteo , los numerales mayas , los numerales cuneiformes y los numerales griegos antiguos . Además, existe una gran cantidad de variaciones tipográficas de los numerales arábigos occidentales, destinadas a usos matemáticos especializados y a la compatibilidad con conjuntos de caracteres anteriores, como ² o ②, y caracteres compuestos como ½.

Numerales por propiedad numérica

Agrupados según su propiedad numérica tal como se usa en un texto, Unicode tiene cuatro valores para el tipo numérico. Primero está el tipo "no es un número". Luego están los números de base decimal , comúnmente usados ​​en los sistemas decimales occidentales (del 0 al 9), los números que no forman parte de un sistema decimal, como los números romanos, y los números decimales en contexto tipográfico, como los números encerrados en un círculo. No se menciona la numeración como "ABC" para la numeración de capítulos.

dígitos hexadecimales

Los dígitos hexadecimales en Unicode no son caracteres separados; se utilizan letras y números existentes. Estos caracteres tienen propiedades de carácterHex_digit=Yes marcadas , y ASCII_Hex_digit=Yescuando corresponde.

Numerales por escritura

dígitos

Unicode incluye los números arábigos occidentales en el bloque latino básico (o derivado de ASCII). Existen otras formas de los diez dígitos en varios alfabetos: árabe oriental , balinés, bengalí, devanagari, etíope, gujarati, gurmukhi, telugu, jemer, lao, limbu, malayalam, mongol, birmano, nuevo tai lue, nko, oriya, tailandés, tibetano y otomano. Unicode incluye una propiedad de valor numérico para cada dígito que facilita la intercalación y otras operaciones de procesamiento de texto. Sin embargo, no existe una correspondencia entre los distintos dígitos relacionados.

Aunque el árabe y algunos otros idiomas se escriben de derecha a izquierda, en la mayoría de los idiomas los números se escriben con el dígito más significativo a la izquierda y el menos significativo a la derecha. Los caracteres Unicode tienen propiedades direccionales, por lo que se escriben de izquierda a derecha [ 1 ] y, por lo tanto, el dígito más significativo debe ir primero en un archivo de texto, independientemente del idioma utilizado.

Los dígitos se pueden reutilizar para bases menores de 10, pero se deben usar letras u otros caracteres para bases hexadecimales o cualquier otra base mayor de 10. Estos caracteres carecen de la propiedad de valor numérico.

Fracciones

El carácter U+2044 / FRACTION SLASH permite a los autores que utilizan Unicode componer cualquier fracción arbitraria junto con los dígitos decimales. Su propósito era indicar a la representación de la fuente que redujera el tamaño de los dígitos circundantes, los elevara a la izquierda y los bajara a la derecha, pero rara vez se implementa. (Una solución alternativa consiste en usar los caracteres de superíndice/subíndice que se describen a continuación, pero solo están disponibles los números arábigos). Unicode también incluye algunas fracciones comunes como caracteres de compatibilidad, pero desaconseja su uso.

fracciones decimales

En Unicode, varios caracteres pueden funcionar como separador decimal según la configuración regional. Las fracciones decimales se representan en texto como una secuencia de dígitos decimales con un separador que separa la parte entera de la parte fraccionaria. Por ejemplo, la fracción decimal de ¼ se expresa como cero coma veinticinco ("0,25"). Unicode no tiene un separador decimal general específico, sino que unifica la función de separador decimal con otros caracteres de puntuación. Así, el punto (.) utilizado en "0,25" es el mismo carácter de punto (U+002E) que se usa para finalizar la oración. Sin embargo, las culturas varían en el glifo o grafema utilizado como separador decimal. Por lo tanto, en algunas configuraciones regionales, se puede usar la coma (U+002C) en su lugar: "0,25". Otras configuraciones regionales usan un espacio (o espacio de no separación) para "0 25". El sistema de escritura árabe incluye un carácter dedicado para un separador decimal que se parece mucho a una coma, U+066B ٫ SEPARADOR DECIMAL ÁRABE , que cuando se combina con los dígitos arábigos para expresar un cuarto aparece como: "٠٫٢٥".

Caracteres para constantes matemáticas

Actualmente, tres caracteres Unicode representan semánticamente constantes matemáticas: U+210E CONSTANTE DE PLANCK , U+210F CONSTANTE DE PLANCK SOBRE DOS PI , y U+2107 CONSTANTE DE EULER (de significado desconocido [ 2 ] ). Otras constantes matemáticas pueden representarse utilizando caracteres que tienen múltiples usos semánticos. Por ejemplo, aunque Unicode incluye un carácter para el exponente natural ℯ (U+212F), su nombre canónico UCS deriva de su glifo: U+212F ESCRITURA E MINÚSCULA ; y la constante matemática π , 3.141592.., está representada por U+03C0 π LETRA GRIEGA MINÚSCULA PI .

Texto enriquecido y otros números de compatibilidad

Los números arábigos occidentales también aparecen entre los caracteres de compatibilidad como variantes de texto enriquecido, incluyendo negrita, doble trazo, monoespaciado, sans-serif y sans-serif negrita, junto con variantes de ancho completo para la compatibilidad con texto vertical heredado.

El texto enriquecido entre paréntesis, rodeado y otras variantes también se incluyen en los bloques Letras y meses CJK encerrados ; Alfanuméricos encerrados ; Suplemento alfanumérico encerrado ; Superíndices y subíndices ; Formas numéricas ; y Símbolos .

Numerales de Suzhou (huāmǎ/Sūzhōu mǎzi)

El sistema huāmǎ ( chino simplificado :花码; chino tradicional :花碼) / Sūzhōu mǎzi ( chino simplificado :苏州码子; chino tradicional :蘇州碼字) es una variación del sistema de numeración de varillas. Los numerales de varillas están estrechamente relacionados con las varillas de conteo y el ábaco , razón por la cual los símbolos numéricos para 1, 2, 3, 6, 7 y 8 en el sistema huāmǎ se representan de manera similar a como lo hacen en el ábaco. Actualmente, el sistema huāmǎ solo se utiliza para mostrar precios en los mercados chinos o en facturas manuscritas tradicionales.

Los dígitos de los numerales de Suzhou se encuentran en el bloque de símbolos y puntuación CJK en U+3021—U+3029, U+3007, U+5341, U+5344 y U+5345. En Unicode 3.0, estos caracteres se denominan incorrectamente numerales de estilo Hangzhou . En Unicode 4.0, se añadió una errata que indicaba: [ 3 ]

Los numerales de Suzhou (en chino su1zhou1ma3zi ) son formas numéricas especiales que utilizan los comerciantes para mostrar los precios de las mercancías. El uso de "HANGZHOU" en los nombres es un error.

Todas las referencias a "Hangzhou" en el estándar Unicode se han corregido a "Suzhou", excepto los nombres de los caracteres, que no se pueden cambiar una vez asignados, según la Política de Estabilidad de Unicode. [ 4 ] (Esta política permite que el software utilice los nombres como identificadores únicos).

Números japoneses y coreanos

Numerales griegos antiguos

Unicode ofrece soporte para varias variantes de numerales griegos , asignadas al Plano Multilingüe Suplementario desde U+10140 hasta U+1018F. [ 5 ]

Los numerales áticos fueron utilizados por los antiguos griegos , posiblemente desde el siglo VII a . C. También se les conocía como numerales herodianos, ya que Herodiano los describió por primera vez en un manuscrito del siglo II . Asimismo, se les denomina numerales acrofónicos porque todos los símbolos utilizados derivan de las primeras letras de las palabras que representan: «uno», «cinco», «diez», «cien», «mil» y «diez mil». Véase Numerales griegos y acrofonía .

números romanos

Los números romanos se originaron en la antigua Roma , adaptados de los números etruscos . El sistema utilizado en la antigüedad clásica se modificó ligeramente en la Edad Media hasta llegar al sistema que usamos hoy en día. Se basa en ciertas letras a las que se les asignan valores numéricos.

Los números romanos se utilizan comúnmente hoy en día en listas numeradas (en formato de esquema), esferas de relojes, páginas que preceden al cuerpo principal de un libro, tríadas de acordes en el análisis musical ( análisis de números romanos ), la numeración de secuelas de películas y videojuegos, fechas de publicación de libros, líderes políticos sucesivos o niños con nombres idénticos, y la numeración de algunos eventos deportivos, como los Juegos Olímpicos o el Super Bowl .

Unicode cuenta con una serie de caracteres específicamente designados como números romanos, que forman parte del rango de Formas Numéricas [ 6 ] desde U+2160 hasta U+2188. Este rango incluye números tanto en mayúsculas como en minúsculas, así como caracteres precombinados para números hasta el 12 (XII). Una de las razones de la existencia de números precombinados es facilitar la representación de números de varias letras (como VIII) en una sola línea horizontal en texto vertical asiático. Sin embargo, el estándar Unicode incluye puntos de código especiales para números romanos únicamente por motivos de compatibilidad, indicando que «para la mayoría de los propósitos, es preferible componer los números romanos a partir de secuencias de las letras latinas correspondientes». [ 7 ]

Además, existen caracteres para las formas arcaicas [ 6 ] de 1000, 5000, 10 000, C invertida grande (Ɔ) , 6 tardío (ↅ, similar al estigma griego : Ϛ), 50 temprano (ↆ, similar a la flecha hacia abajo ↓⫝⊥ [ 8 ] ), 50 000 y 100 000. La c invertida pequeña, ↄ, no está destinada a ser utilizada en números romanos, sino como letra claudiana minúscula Ↄ.

Si se utilizan tipografías góticas o cursivas , los números romanos se muestran en tipografía romana . Dichas tipografías pueden contener números romanos que coincidan con el estilo de la tipografía en el rango Unicode U+2160–217F; si no existen, se utiliza una tipografía Antiqua equivalente para los números romanos.

Unicode tiene caracteres para fracciones romanas en el bloque Símbolos antiguos [ 10 ] : sextans, uncia, semuncia, sextula, dimidia sextula, siliqua y as.

Numeración con varillas de conteo

Los numerales de varilla de conteo se incluyen en su propio bloque en el Plano Multilingüe Suplementario (SMP) a partir de Unicode 5.0. Hay nueve dígitos "horizontales" (U+1D360 a U+1D368) y nueve dígitos "verticales" (U+1D369 a U+1D371), los dígitos horizontales se usan para potencias impares de diez y los dígitos verticales para potencias pares de diez. El cero debe representarse con U+3007 (〇, número ideográfico cero) y el signo negativo debe representarse con U+20E5 (combinando la superposición de solidus invertido). [ 11 ] Este bloque también contiene otros símbolos similares a varillas de conteo, como la conocida marca de conteo para 5 | | | | . Como estos se agregaron recientemente al conjunto de caracteres y no están en el BMP, la compatibilidad de fuentes aún puede ser limitada.

Véase también

Referencias

  1. "Base de datos de caracteres Unicode: Clase bidireccional derivada" . 24/07/2025.
  2. Se desconoce a qué constante se refiere. El estándar XCCS 353/046 de Xerox simplemente dice "Euler".
  3. Freytag, Asmus; Rick McGowan; Ken Whistler (8 de mayo de 2006). "UTN n.° 27: Anomalías conocidas en los nombres de caracteres Unicode" . Notas técnicas . Consorcio Unicode . Consultado el 13 de junio de 2008 .
  4. "Estabilidad de nombres" . Política de estabilidad de la codificación de caracteres Unicode . Consorcio Unicode. 28 de febrero de 2008. Consultado el 13 de junio de 2008 .
  5. Tablas Unicode: Números griegos antiguos
  6. 1 2 Formas numéricas Unicode
  7. El estándar Unicode, versión 6.0 – Edición electrónica (PDF) , Unicode, Inc., 2011, pág. 486 
  8. David J. Perry: Propuesta para añadir personajes romanos antiguos adicionales al UCS
  9. Para las dos primeras filas
  10. Símbolos antiguos de Unicode
  11. El estándar Unicode, versión 5.0 – Edición electrónica (PDF) , Unicode, Inc., 2006, págs . 499–500