
A partir de la versión 17.0 de Unicode , existen 297 334 caracteres asignados con puntos de código , [ 1 ] que abarcan 172 sistemas de escritura modernos e históricos , así como múltiples conjuntos de símbolos. Dado que no es técnicamente posible enumerar todos estos caracteres en una sola página, esta lista se limita a un subconjunto de los caracteres más importantes para los lectores de habla inglesa, con enlaces a otras páginas que enumeran los caracteres complementarios. Por consiguiente, este artículo enumera los 1062 caracteres del subconjunto del Conjunto de Caracteres Europeos Multilingües 2 ( MES-2 ), y algunos caracteres adicionales relacionados. (El término «carácter Unicode» se acuñó para categorizar los caracteres que no tienen puntos de código ASCII ).
Resumen de referencias de personajes

HTML y XML ofrecen formas de hacer referencia a caracteres Unicode cuando estos no pueden o no deben utilizarse. Una referencia numérica a un carácter se refiere a él mediante su código Unicode ( Unicode) , mientras que una referencia a una entidad de carácter se refiere a él mediante un nombre predefinido.
Una referencia de caracteres numéricos utiliza el formato
&#nnnn;
o
&#xhhhh;
donde nnnn es el punto de código en formato decimal y hhhh es el punto de código en formato hexadecimal . La x debe estar en minúscula en los documentos XML. nnnn o hhhh pueden contener cualquier número de dígitos y pueden incluir ceros iniciales. hhhh puede combinar mayúsculas y minúsculas, aunque lo habitual es usar mayúsculas.
En cambio, una referencia a una entidad de carácter se refiere a un carácter mediante el nombre de una entidad que tiene el carácter deseado como texto de reemplazo . La entidad debe estar predefinida (integrada en el lenguaje de marcado) o declarada explícitamente en una Definición de Tipo de Documento (DTD). El formato es el mismo que para cualquier referencia a una entidad:
&nombre;
donde nombre es el nombre de la entidad, respetando las mayúsculas y minúsculas. El punto y coma es obligatorio.
Debido a que a los humanos les resulta más difícil recordar los números que los nombres, las referencias a entidades de caracteres suelen ser escritas por humanos, mientras que las referencias a caracteres numéricos suelen ser producidas por programas informáticos. [ 2 ]
Códigos de control
65 caracteres, incluyendo DEL . Todos pertenecen al alfabeto común .
Notas a pie de página:
- 1. La tecla Control-C se ha utilizado normalmente como tecla de "interrupción" o "parón".
- 2. La combinación Control-D se utilizaba para indicar el "fin de archivo" del texto escrito en la terminal de los sistemas Unix/Linux. Windows, MS-DOS y los miniordenadores más antiguos utilizaban Control-Z para este fin.
- 3. La combinación Control-G es un vestigio de la época en que se usaban los teletipos . Los mensajes importantes se podían señalar haciendo sonar la campana del teletipo. Esta función se mantuvo en las PC mediante la generación de un zumbido.
- 4 El salto de línea se utiliza para indicar el "fin de línea" en archivos de texto en sistemas Unix/Linux.
- El retorno de carro (acompañado de un salto de línea, y por lo tanto escrito generalmente como 'CRLF') se utiliza como carácter de "fin de línea" en Windows, MS-DOS y la mayoría de los miniordenadores, excepto los sistemas basados en Unix/Linux. El Mac OS clásico y otros sistemas operativos antiguos solo utilizaban CR.
- 6 Control-O ha sido la tecla para "descartar la salida". La salida no se envía al terminal, sino que se descarta, hasta que se vuelva a pulsar Control-O.
- 7. Se ha utilizado Control-Q para indicarle a una computadora host que reanude el envío de salida después de que Control-S la haya detenido.
- 8. La combinación Control-S se ha utilizado para indicarle a un ordenador anfitrión que posponga el envío de la salida al terminal. La salida se suspende hasta que se reinicia con la tecla Control-Q.
- 9 La tecla Control-U era utilizada originalmente por las computadoras de Digital Equipment Corporation para cancelar la línea actual de texto escrito. Otros fabricantes utilizaban Control-X para este propósito.
- 10. La combinación Control-X se usaba comúnmente para cancelar una línea de texto introducida en la terminal.
- 11. La combinación Control-Z se ha utilizado comúnmente en minicomputadoras, sistemas Windows y MS-DOS para indicar el "fin de archivo", ya sea en una terminal o en un archivo de texto. Los sistemas Unix/Linux utilizan Control-D para indicar el fin de archivo en una terminal.
escritura latina
El estándar Unicode (versión 17.0 ) clasifica 1.492 caracteres como pertenecientes al alfabeto latino.
Latín básico
95 caracteres; los 52 caracteres del alfabeto pertenecen al alfabeto latino. Los 43 restantes pertenecen al alfabeto común . Los 33 caracteres clasificados como puntuación y símbolos ASCII también se conocen a veces como caracteres especiales ASCII . A menudo, cuando una organización indica que una contraseña "requiere signos de puntuación", se refiere únicamente a estos caracteres (y no a otros signos de puntuación Unicode).
Suplemento Latino-1
96 caracteres; las 62 letras y dos indicadores ordinales pertenecen al alfabeto latino. Los 32 restantes pertenecen al alfabeto común .
Latín extendido-A
128 caracteres; todos pertenecen al alfabeto latino.
Latín extendido-B
208 caracteres; todos pertenecen al alfabeto latino; 33 en el subconjunto MES-2.
Español Latín extendido adicional
256 caracteres; todos pertenecen al alfabeto latino; 23 en el subconjunto MES-2.
Latín adicional extendido
- Latín extendido-C (bloque Unicode)
- Latín extendido-D (bloque Unicode)
- Latín extendido-E (bloque Unicode)
- Latín extendido-F (bloque Unicode)
- Latín extendido-G (bloque Unicode)
Escrituras fonéticas
Extensiones del IPA
96 caracteres; todos pertenecen al alfabeto latino; tres en el subconjunto MES-2.
Letras modificadoras de espaciado
80 caracteres; 15 en el subconjunto MES-2.
Extensiones fonéticas
- Extensiones fonéticas (bloque Unicode)
- Suplemento de extensiones fonéticas (bloque Unicode)
Marcas combinadas
Griego y copto
144 puntos de código; 135 caracteres asignados; 85 en el subconjunto MES-2.
Griego extendido
Para ortografía politónica : 256 puntos de código; 233 caracteres asignados, todos en el subconjunto MES-2 (#670 – 902).
cirílico
256 caracteres; 191 en el subconjunto MES-2.
Suplementos cirílicos
- Suplemento cirílico (bloque Unicode)
- Cirílico extendido-A (bloque Unicode)
- Cirílico extendido-B (bloque Unicode)
- Cirílico extendido-C (bloque Unicode)
- Cirílico extendido-D (bloque Unicode)
armenio
Lenguas semíticas
árabe
hebreo
siríaco
Mandaico
samaritano
Thaana
Escrituras bráhmicas (índicas)
El rango de U+0900 a U+0DFF incluye Devanagari , escritura bengalí , Gurmukhi , escritura gujarati , alfabeto odia , escritura tamil , escritura telugu , escritura kannada , escritura malayalam y escritura cingalesa .
Devanagari
Bengalí y asamés
Gurmukhi
Gujarati
Oriya
Tamil
Telugu
Kannada
Malayalam
Sinhala
Otras escrituras bráhmicas
Otros alfabetos bráhmicos e índicos en Unicode incluyen:
- Ahom (bloque Unicode)
- Balinés (bloque Unicode)
- Batak (bloque Unicode)
- Bhaiksuki (bloque Unicode)
- Buhid (bloque Unicode)
- Buginés (bloque Unicode)
- Chakma (bloque Unicode)
- Cham (bloque Unicode)
- Formas comunes de números índicos (bloque Unicode)
- Dives Akuru (bloque Unicode)
- Dogra (bloque Unicode)
- Grantha (bloque Unicode)
- Gurung Khema (bloque Unicode)
- Hanunoo (bloque Unicode)
- Javanés (bloque Unicode)
- Kaithi (bloque Unicode)
- Kawi (bloque Unicode)
- Jemer (bloque Unicode)
- Símbolos jemeres (bloque Unicode)
- Khojki (bloque Unicode)
- Khudawadi (bloque Unicode)
- Kirat Rai (bloque Unicode)
- Lao (bloque Unicode)
- Lepcha (bloque Unicode)
- Limbu (bloque Unicode)
- Mahajani (bloque Unicode)
- Makassar (bloque Unicode)
- Marchen (bloque Unicode)
- Meetei Mayek (bloque Unicode)
- Extensiones de Meetei Mayek (bloque Unicode)
- Modi (bloque Unicode)
- Multani (bloque Unicode)
- Myanmar (bloque Unicode)
- Myanmar Extendido-A (bloque Unicode)
- Myanmar Extended-B (bloque Unicode)
- Myanmar Extended-C (bloque Unicode)
- Nuevo Tai Lue (bloque Unicode)
- Newa (bloque Unicode)
- Phags-pa (bloque Unicode)
- Rejang (bloque Unicode)
- Saurashtra (bloque Unicode)
- Sharada (bloque Unicode)
- Suplemento de Sharada (bloque Unicode)
- Siddham (bloque Unicode)
- Sundanés (bloque Unicode)
- Suplemento sundanés (bloque Unicode)
- Syloti Nagri (bloque Unicode)
- Tagalo (bloque Unicode)
- Tagbanwa (bloque Unicode)
- Tai Le (bloque Unicode)
- Tai Tham (bloque Unicode)
- Tai Viet (bloque Unicode)
- Tai Yo (bloque Unicode)
- Takri (bloque Unicode)
- Tailandés (bloque Unicode)
- Tibetano (bloque Unicode)
- Tirhuta (bloque Unicode)
- Tulu-Tigalari (bloque Unicode)
Otros sistemas de escritura del sur y centro de Asia
- Gunjala Gondi (bloque Unicode)
- Masaram Gondi (bloque Unicode)
- Mro (bloque Unicode)
- Nag Mundari (bloque Unicode)
- Ol Chiki (bloque Unicode)
- Ol Onal (bloque Unicode)
- Sora Sompeng (bloque Unicode)
- Sunuwar (bloque Unicode)
- Tangsa (bloque Unicode)
- Tolong Siki (bloque Unicode)
- Toto (bloque Unicode)
- Warang Citi (bloque Unicode)
Sistemas de escritura del sudeste asiático
georgiano
Escrituras africanas
Ge'ez/Escritura etíope
Otros sistemas de escritura africanos
- Adlam (bloque Unicode)
- Bamum (bloque Unicode)
- Suplemento de Bamum (bloque Unicode)
- Beria Erfe (bloque Unicode)
- Bassa Vah (bloque Unicode)
- Garay (bloque Unicode)
- Medefaidrina (bloque Unicode)
- Mende Kikakui (bloque Unicode)
- NKo (bloque Unicode)
- Osmanya (bloque Unicode)
- Números Siyaq otomanos
- Tifinagh (bloque Unicode)
- Vai (bloque Unicode)
guiones estadounidenses
Sistema silábico unificado canadiense para los pueblos indígenas
Otros guiones estadounidenses
mongol
Símbolos Unicode
Puntuación general
112 puntos de código; 111 caracteres asignados; 24 en el subconjunto MES-2.
Superíndices y subíndices
Símbolos monetarios
Símbolos parecidos a letras
Formas numéricas
Flechas
- Símbolos y flechas diversos (bloque Unicode)
- Flechas suplementarias-A (bloque Unicode)
- Flechas suplementarias-B (bloque Unicode)
- Flechas suplementarias-C (bloque Unicode)
Símbolos matemáticos
- Operadores matemáticos suplementarios (bloque Unicode)
- Símbolos matemáticos diversos-A (bloque Unicode)
- Símbolos matemáticos diversos-B (bloque Unicode)
- Símbolos alfanuméricos matemáticos: Símbolos alfanuméricos matemáticos (bloque Unicode)
Información técnica diversa
Imágenes de control
Reconocimiento óptico de caracteres
Alfanuméricos encerrados
Dibujo de caja
Elementos de bloque
Formas geométricas
Símbolos para la informática heredada
Suplemento sobre símbolos para la informática heredada
Símbolos varios
Suplemento de símbolos diversos
Tontos
Sistemas de escritura de Asia oriental
Símbolos y puntuación CJK
Hiragana
Katakana
- Kana Extendido-A (bloque Unicode)
- Kana Extendido-B (bloque Unicode)
- Suplemento Kana (bloque Unicode)
- Extensiones fonéticas de Katakana (bloque Unicode)
- Extensión de Kana pequeña (bloque Unicode)
Bopomofo
Hangul Jamo y compatibilidad Jamo
Kanbun
Se adjuntan cartas y meses CJK
Compatibilidad con CJK
Formularios de compatibilidad CJK
Ideogramas unificados CJK
Radicales CJK
Otros sistemas de escritura de Asia Oriental
- Numerales de varilla de conteo (bloque Unicode)
- Formatos de ancho medio y ancho completo (bloque Unicode)
- Caracteres de descripción ideográfica (bloque Unicode)
- Escritura pequeña khitan (bloque Unicode)
- Lisu (bloque Unicode)
- Suplemento Lisu (bloque Unicode)
- Miao (bloque Unicode)
- Letras de tono modificador (bloque Unicode)
- Nushu (bloque Unicode)
- Nyiakeng Puachue Hmong (bloque Unicode)
- Variantes de formato pequeño (bloque Unicode)
- Símbolos de Tai Xuan Jing (bloque Unicode)
- Tangut (bloque Unicode)
- Componentes Tangut (bloque Unicode)
- Suplemento de componentes Tangut (bloque Unicode)
- Suplemento Tangut (bloque Unicode)
- Formularios verticales (bloque Unicode)
- Wancho (bloque Unicode)
- Sílabas Yi (bloque Unicode)
- Radicales Yi (bloque Unicode)
- Símbolos de los hexagramas del I Ching (bloque Unicode)
Formularios de presentación alfabéticos
Escrituras antiguas e históricas
- Números del Egeo (bloque Unicode)
- Jeroglíficos anatolios (bloque Unicode)
- Números griegos antiguos (bloque Unicode)
- Símbolos antiguos (bloque Unicode)
- Avestan (bloque Unicode)
- Brahmi (bloque Unicode)
- Carian (bloque Unicode)
- Albanés caucásico (bloque Unicode)
- Corasmiano (bloque Unicode)
- Cuneiforme (bloque Unicode)
- Números cuneiformes y puntuación (bloque Unicode)
- Silabario chipriota (bloque Unicode)
- Chipriota-minoico (bloque Unicode)
- Escritura cuneiforme del período dinástico temprano (bloque Unicode)
- Controles de formato de jeroglíficos egipcios (bloque Unicode)
- Jeroglíficos egipcios (bloque Unicode)
- Jeroglíficos egipcios extendidos-A (bloque Unicode)
- Elbasan (bloque Unicode)
- Elymaic (bloque Unicode)
- Glagolítico (bloque Unicode)
- Suplemento glagolítico (bloque Unicode)
- Gótico (bloque Unicode)
- Hatran (bloque Unicode)
- Arameo imperial (bloque Unicode)
- Números Siyaq Indic
- Pahlavi inscriptivo (bloque Unicode)
- Parto inscribcional (bloque Unicode)
- Kharoshthi (bloque Unicode)
- Lineal A (bloque Unicode)
- Ideogramas lineales B (bloque Unicode)
- Silabario Lineal B (bloque Unicode)
- Licio (bloque Unicode)
- Lidio (bloque Unicode)
- Maniqueo (bloque Unicode)
- Numerales mayas (bloque Unicode)
- Cursiva meroítica (bloque Unicode)
- Jeroglíficos meroíticos (bloque Unicode)
- Nabateo (bloque Unicode)
- Nandinagari (bloque Unicode)
- Ogham (bloque Unicode)
- Húngaro antiguo (bloque Unicode)
- Cursiva antigua (bloque Unicode)
- Árabe septentrional antiguo (bloque Unicode)
- Antiguo permic (bloque Unicode)
- Persa antiguo (bloque Unicode)
- Sogdiano antiguo (bloque Unicode)
- Antiguo árabe del sur (bloque Unicode)
- Túrquico antiguo (bloque Unicode)
- Antiguo uigur (bloque Unicode)
- Palmireno (bloque Unicode)
- Disco de Festos (bloque Unicode)
- Fenicio (bloque Unicode)
- Salterio Pahlavi (bloque Unicode)
- Rúnico (bloque Unicode)
- Sidetic (bloque Unicode)
- Sogdiano (bloque Unicode)
- Soyombo (bloque Unicode)
- Todhri (bloque Unicode)
- Ugarítico (bloque Unicode)
- Vithkuqi (bloque Unicode)
- Yazidí (bloque Unicode)
- Plaza Zanabazar (bloque Unicode)
Shavian
Sistemas de notación
Braille
- Patrones Braille (bloque Unicode)
Música
- Símbolos musicales occidentales (bloque Unicode)
- Símbolos musicales bizantinos (bloque Unicode)
- Notación musical de la antigua Grecia (bloque Unicode)
- Notación musical Znamenny (bloque Unicode)
Taquigrafía
- Duployan (bloque Unicode)
- Controles de formato abreviado (bloque Unicode)
Rotulación Sutton
- Sutton SignWriting: Sutton SignWriting (bloque Unicode)
Emoji
Símbolos alquímicos
Símbolos del juego
Fichas de Mahjong
fichas de dominó
Naipes
Símbolos de ajedrez
Áreas especiales y caracteres de formato
Véase también
- Comparación de codificaciones Unicode
- Tipografías Unicode de código abierto
- GNU Unifont – Fuente de mapa de bits de doble espacio
- Lista de radicales en Unicode
- Lista de fuentes Unicode
- Lista de tipografías
- Unidad tipográfica
- Consorcio Unicode
- Fuente de reserva : tipo de fuente de reserva
- fuente Unicode
- Personajes del conjunto de caracteres universal
- Subconjunto Unicode DIN 91379 para Europa
- Lista de letras cirílicas
- Lista de letras latinas por forma
Referencias
- ↑ "Recuento de caracteres de la versión Unicode 17.0" .
- ↑ Carey, Patrick (2015). Nuevas perspectivas sobre XML : exhaustivo . Sasha Vodnik (3.ª ed.). Cengage Learning. pág. 36. ISBN 978-1-285-07582-2OCLC 904969019
- ↑ Obsoleto a partir de la versión 5.2.0 de Unicode."La letra latina minúscula 'n' precedida de un apóstrofo (U+0149) se codificó para su uso en afrikáans. Este carácter está en desuso y se desaconseja su uso. En casi todos los casos, se representa mejor mediante una secuencia de un apóstrofo seguido de una 'n'."pág. 208
- ↑ Batjargal, Biligsaikhan; Khaltarkhuu, Garmaabazar; Fuminori, Kimura; Maeda, Akira (2011). "Un estudio de las codificaciones y la representación de la escritura mongola tradicional: uso de Unicode en fuentes OpenType" (PDF) . Revista internacional sobre procesamiento de lenguajes asiáticos . 21 (1): 33. Recuperado el 1 de octubre de 2025 .
- Tablas de códigos de caracteres Unicode , Unicode, Inc.
- CWA 13873:2000 – Subconjuntos europeos multilingües en ISO/IEC 10646-1 Acuerdo de taller CEN 13873
- Fundamentos del conjunto de caracteres europeos multilingües 2 (MES-2) , Markus Kuhn , 1998
Enlaces externos
- Sitio web oficial del Consorcio Unicode (en inglés)