Articulo de referencia

Lista de caracteres Unicode

Logotipo Unicode A partir de la versión 17.0 de Unicode , existen 297 334 caracteres asignados con puntos de código , [ 1 ] que abarcan 172 sistemas de escritura modernos e hist...

Logotipo Unicode

A partir de la versión 17.0 de Unicode , existen 297 334 caracteres asignados con puntos de código , [ 1 ] que abarcan 172 sistemas de escritura modernos e históricos , así como múltiples conjuntos de símbolos. Dado que no es técnicamente posible enumerar todos estos caracteres en una sola página, esta lista se limita a un subconjunto de los caracteres más importantes para los lectores de habla inglesa, con enlaces a otras páginas que enumeran los caracteres complementarios. Por consiguiente, este artículo enumera los 1062 caracteres del subconjunto del Conjunto de Caracteres Europeos Multilingües 2 ( MES-2 ), y algunos caracteres adicionales relacionados. (El término «carácter Unicode» se acuñó para categorizar los caracteres que no tienen puntos de código ASCII ).

Resumen de referencias de personajes

HTML y XML ofrecen formas de hacer referencia a caracteres Unicode cuando estos no pueden o no deben utilizarse. Una referencia numérica a un carácter se refiere a él mediante su código Unicode ( Unicode) , mientras que una referencia a una entidad de carácter se refiere a él mediante un nombre predefinido.

Una referencia de caracteres numéricos utiliza el formato

&#nnnn;

o

&#xhhhh;

donde nnnn es el punto de código en formato decimal y hhhh es el punto de código en formato hexadecimal . La x debe estar en minúscula en los documentos XML. nnnn o hhhh pueden contener cualquier número de dígitos y pueden incluir ceros iniciales. hhhh puede combinar mayúsculas y minúsculas, aunque lo habitual es usar mayúsculas.

En cambio, una referencia a una entidad de carácter se refiere a un carácter mediante el nombre de una entidad que tiene el carácter deseado como texto de reemplazo . La entidad debe estar predefinida (integrada en el lenguaje de marcado) o declarada explícitamente en una Definición de Tipo de Documento (DTD). El formato es el mismo que para cualquier referencia a una entidad:

&nombre;

donde nombre es el nombre de la entidad, respetando las mayúsculas y minúsculas. El punto y coma es obligatorio.

Debido a que a los humanos les resulta más difícil recordar los números que los nombres, las referencias a entidades de caracteres suelen ser escritas por humanos, mientras que las referencias a caracteres numéricos suelen ser producidas por programas informáticos. [ 2 ]

Códigos de control

65 caracteres, incluyendo DEL . Todos pertenecen al alfabeto común .

Notas a pie de página:

1. La tecla Control-C se ha utilizado normalmente como tecla de "interrupción" o "parón".
2. La combinación Control-D se utilizaba para indicar el "fin de archivo" del texto escrito en la terminal de los sistemas Unix/Linux. Windows, MS-DOS y los miniordenadores más antiguos utilizaban Control-Z para este fin.
3. La combinación Control-G es un vestigio de la época en que se usaban los teletipos . Los mensajes importantes se podían señalar haciendo sonar la campana del teletipo. Esta función se mantuvo en las PC mediante la generación de un zumbido.
4 El salto de línea se utiliza para indicar el "fin de línea" en archivos de texto en sistemas Unix/Linux.
El retorno de carro (acompañado de un salto de línea, y por lo tanto escrito generalmente como 'CRLF') se utiliza como carácter de "fin de línea" en Windows, MS-DOS y la mayoría de los miniordenadores, excepto los sistemas basados ​​en Unix/Linux. El Mac OS clásico y otros sistemas operativos antiguos solo utilizaban CR.
6 Control-O ha sido la tecla para "descartar la salida". La salida no se envía al terminal, sino que se descarta, hasta que se vuelva a pulsar Control-O.
7. Se ha utilizado Control-Q para indicarle a una computadora host que reanude el envío de salida después de que Control-S la haya detenido.
8. La combinación Control-S se ha utilizado para indicarle a un ordenador anfitrión que posponga el envío de la salida al terminal. La salida se suspende hasta que se reinicia con la tecla Control-Q.
9 La tecla Control-U era utilizada originalmente por las computadoras de Digital Equipment Corporation para cancelar la línea actual de texto escrito. Otros fabricantes utilizaban Control-X para este propósito.
10. La combinación Control-X se usaba comúnmente para cancelar una línea de texto introducida en la terminal.
11. La combinación Control-Z se ha utilizado comúnmente en minicomputadoras, sistemas Windows y MS-DOS para indicar el "fin de archivo", ya sea en una terminal o en un archivo de texto. Los sistemas Unix/Linux utilizan Control-D para indicar el fin de archivo en una terminal.

escritura latina

El estándar Unicode (versión 17.0 ) clasifica 1.492 caracteres como pertenecientes al alfabeto latino.

Latín básico

95 caracteres; los 52 caracteres del alfabeto pertenecen al alfabeto latino. Los 43 restantes pertenecen al alfabeto común . Los 33 caracteres clasificados como puntuación y símbolos ASCII también se conocen a veces como caracteres especiales ASCII . A menudo, cuando una organización indica que una contraseña "requiere signos de puntuación", se refiere únicamente a estos caracteres (y no a otros signos de puntuación Unicode).

Suplemento Latino-1

96 caracteres; las 62 letras y dos indicadores ordinales pertenecen al alfabeto latino. Los 32 restantes pertenecen al alfabeto común .

Latín extendido-A

128 caracteres; todos pertenecen al alfabeto latino.

Latín extendido-B

208 caracteres; todos pertenecen al alfabeto latino; 33 en el subconjunto MES-2.

Español Latín extendido adicional

256 caracteres; todos pertenecen al alfabeto latino; 23 en el subconjunto MES-2.

Latín adicional extendido

Escrituras fonéticas

Extensiones del IPA

96 caracteres; todos pertenecen al alfabeto latino; tres en el subconjunto MES-2.

Letras modificadoras de espaciado

80 caracteres; 15 en el subconjunto MES-2.

Extensiones fonéticas

Marcas combinadas

Griego y copto

144 puntos de código; 135 caracteres asignados; 85 en el subconjunto MES-2.

Griego extendido

Para ortografía politónica : 256 puntos de código; 233 caracteres asignados, todos en el subconjunto MES-2 (#670 – 902). 

cirílico

256 caracteres; 191 en el subconjunto MES-2.

Suplementos cirílicos

armenio

Lenguas semíticas

árabe

hebreo

siríaco

Mandaico

samaritano

Thaana

Escrituras bráhmicas (índicas)

El rango de U+0900 a U+0DFF incluye Devanagari , escritura bengalí , Gurmukhi , escritura gujarati , alfabeto odia , escritura tamil , escritura telugu , escritura kannada , escritura malayalam y escritura cingalesa .

Devanagari

Bengalí y asamés

Gurmukhi

Gujarati

Oriya

Tamil

Telugu

Kannada

Malayalam

Sinhala

Otras escrituras bráhmicas

Otros alfabetos bráhmicos e índicos en Unicode incluyen:

Otros sistemas de escritura del sur y centro de Asia

Sistemas de escritura del sudeste asiático

georgiano

Escrituras africanas

Ge'ez/Escritura etíope

Otros sistemas de escritura africanos

guiones estadounidenses

Sistema silábico unificado canadiense para los pueblos indígenas

Otros guiones estadounidenses

mongol

Símbolos Unicode

Puntuación general

112 puntos de código; 111 caracteres asignados; 24 en el subconjunto MES-2.

Superíndices y subíndices

Símbolos monetarios

Símbolos parecidos a letras

Formas numéricas

Flechas

Símbolos matemáticos

Información técnica diversa

Imágenes de control

Reconocimiento óptico de caracteres

Alfanuméricos encerrados

Dibujo de caja

Elementos de bloque

Formas geométricas

Símbolos para la informática heredada

Suplemento sobre símbolos para la informática heredada

Símbolos varios

Suplemento de símbolos diversos

Tontos

Sistemas de escritura de Asia oriental

Símbolos y puntuación CJK

Hiragana

Katakana

Bopomofo

Hangul Jamo y compatibilidad Jamo

Kanbun

Se adjuntan cartas y meses CJK

Compatibilidad con CJK

Formularios de compatibilidad CJK

Ideogramas unificados CJK

Radicales CJK

Otros sistemas de escritura de Asia Oriental

Formularios de presentación alfabéticos

Escrituras antiguas e históricas

Shavian

Sistemas de notación

Braille

Música

Taquigrafía

Rotulación Sutton

Emoji

Símbolos alquímicos

Símbolos del juego

Fichas de Mahjong

fichas de dominó

Naipes

Símbolos de ajedrez

Áreas especiales y caracteres de formato

Véase también

Referencias

  1. "Recuento de caracteres de la versión Unicode 17.0" .
  2. Carey, Patrick (2015). Nuevas perspectivas sobre XML : exhaustivo . Sasha Vodnik (3.ª ed.). Cengage Learning. pág. 36. ISBN    978-1-285-07582-2OCLC 904969019 
  3. Obsoleto a partir de la versión 5.2.0 de Unicode."La letra latina minúscula 'n' precedida de un apóstrofo (U+0149) se codificó para su uso en afrikáans. Este carácter está en desuso y se desaconseja su uso. En casi todos los casos, se representa mejor mediante una secuencia de un apóstrofo seguido de una 'n'."pág. 208
  4. Batjargal, Biligsaikhan; Khaltarkhuu, Garmaabazar; Fuminori, Kimura; Maeda, Akira (2011). "Un estudio de las codificaciones y la representación de la escritura mongola tradicional: uso de Unicode en fuentes OpenType" (PDF) . Revista internacional sobre procesamiento de lenguajes asiáticos . 21 (1): 33. Recuperado el 1 de octubre de 2025 .
  • Tablas de códigos de caracteres Unicode , Unicode, Inc.
  • CWA 13873:2000  – Subconjuntos europeos multilingües en ISO/IEC 10646-1 Acuerdo de taller CEN 13873
  • Fundamentos del conjunto de caracteres europeos multilingües 2 (MES-2) , Markus Kuhn , 1998
  • Sitio web oficial del Consorcio Unicode (en inglés)
Obtenido de " https://en.wikipedia.org/w/index.php?title=List_of_Unicode_characters&oldid=1358563470 "