
1010111.La codificación de caracteres es una convención que utiliza un valor numérico para representar cada carácter de un sistema de escritura . Un conjunto de caracteres no solo puede incluir símbolos del lenguaje natural , sino también códigos con significados o funciones ajenas al lenguaje, como caracteres de control y espacios en blanco . También se han definido codificaciones de caracteres para algunos lenguajes construidos . Una vez codificados, los datos de caracteres pueden almacenarse, transmitirse y transformarse mediante un ordenador . [ 1 ] Los valores numéricos que componen una codificación de caracteres se conocen como puntos de código y, en conjunto, conforman un espacio de código o una página de código .
Las primeras codificaciones de caracteres, que se originaron con la telegrafía óptica o eléctrica y en las primeras computadoras, solo podían representar un subconjunto de los caracteres utilizados en los idiomas, a veces restringido a letras mayúsculas , números y signos de puntuación limitados . Con el tiempo, se crearon codificaciones capaces de representar más caracteres, como ASCII , ISO/IEC 8859 y las codificaciones Unicode como UTF-8 y UTF-16 .
La codificación de caracteres más popular en la World Wide Web es UTF-8, que se utiliza en el 98,9% de los sitios web encuestados, según datos de enero de 2026. . [ 2 ] En programas de aplicación y tareas del sistema operativo , tanto UTF-8 como UTF-16 son opciones populares. [ 3 ]
Historia
La historia de los códigos de caracteres ilustra la creciente necesidad de transmitir información simbólica basada en caracteres a distancia mediante máquinas, utilizando medios eléctricos que en su momento fueron novedosos. Los primeros códigos se basaban en sistemas de codificación y cifrado manuales y manuscritos, como el cifrado de Bacon , el Braille , las banderas de señales marítimas internacionales y la codificación de cuatro dígitos de caracteres chinos para un código telegráfico chino ( Hans Schjellerup , 1869). Con la adopción de técnicas eléctricas y electromecánicas, estos primeros códigos se adaptaron a las nuevas capacidades y limitaciones de las primeras máquinas. El primer código de caracteres transmitido eléctricamente conocido, el código Morse , introducido en la década de 1840, utilizaba un sistema de cuatro "símbolos" (señal corta, señal larga, espacio corto, espacio largo) para generar códigos de longitud variable. Aunque algunos usos comerciales del código Morse se realizaron mediante maquinaria, a menudo se utilizaba como código manual, generado a mano con una llave telegráfica y descifrable al oído, y aún se utiliza en la radioafición y la aeronáutica . La mayoría de los códigos tienen una longitud fija por carácter o son secuencias de longitud variable de códigos de longitud fija (por ejemplo, Unicode ). [ 4 ]
Algunos ejemplos comunes de sistemas de codificación de caracteres son el código Morse, el código Baudot , el Código Estándar Estadounidense para el Intercambio de Información (ASCII) y Unicode. Unicode, un sistema de codificación bien definido y extensible, ha reemplazado a la mayoría de las codificaciones de caracteres anteriores, pero la trayectoria del desarrollo de los códigos hasta la actualidad es bastante conocida.
El código Baudot, una codificación de cinco bits , fue creado por Émile Baudot en 1870, patentado en 1874, modificado por Donald Murray en 1901 y estandarizado por la CCITT como Alfabeto Telegráfico Internacional n.° 2 (ITA2) en 1930. El nombre Baudot se ha aplicado erróneamente a ITA2 y sus numerosas variantes. ITA2 presentaba muchas deficiencias y fue mejorado con frecuencia por diversos fabricantes de equipos, lo que en ocasiones generó problemas de compatibilidad.

Herman Hollerith inventó la codificación de datos mediante tarjetas perforadas a finales del siglo XIX para analizar datos censales. Inicialmente, cada perforación representaba un elemento de datos diferente, pero posteriormente, la información numérica se codificaba numerando las filas inferiores del 0 al 9, con una perforación en una columna que representaba su número de fila. Más tarde, los datos alfabéticos se codificaban permitiendo más de una perforación por columna. Las máquinas tabuladoras electromecánicas representaban la fecha internamente mediante la sincronización de pulsos con el movimiento de las tarjetas a través de la máquina.
Cuando IBM pasó al procesamiento electrónico, comenzando con el multiplicador electrónico IBM 603 , utilizó una variedad de esquemas de codificación binaria que estaban vinculados al código de tarjeta perforada. IBM utilizó varios esquemas de codificación de caracteres decimal codificado en binario (BCD) de seis bits, comenzando ya en 1953 en sus computadoras 702 [ 5 ] y 704 , y en sus series posteriores 7000 y 1400 , así como en periféricos asociados. Dado que el código de tarjeta perforada en uso entonces se limitaba a dígitos, letras mayúsculas inglesas y algunos caracteres especiales, seis bits eran suficientes. Estas codificaciones BCD extendieron la codificación numérica simple de cuatro bits existente para incluir caracteres alfabéticos y especiales, mapeándolos fácilmente a la codificación de tarjeta perforada que ya estaba ampliamente extendida. Los códigos de IBM se usaban principalmente con equipos IBM. Otros proveedores de computadoras de la época tenían sus propios códigos de caracteres, a menudo de seis bits, como la codificación utilizada por la UNIVAC I. [ 6 ] Por lo general, tenían la capacidad de leer cintas producidas en equipos IBM. Las codificaciones BCD de IBM fueron las precursoras de su Código de Intercambio Decimal Codificado en Binario Extendido (generalmente abreviado como EBCDIC), un esquema de codificación de ocho bits desarrollado en 1963 para el IBM System/360 que presentaba un conjunto de caracteres más amplio, incluidas las letras minúsculas.
En 1959, el ejército estadounidense definió su código Fieldata , un código de seis o siete bits, introducido por el Cuerpo de Señales del Ejército de los EE. UU. Si bien Fieldata resolvió muchos de los problemas de la época (por ejemplo, códigos de letras y dígitos organizados para la intercalación automática), no alcanzó sus objetivos y tuvo una vida corta. En 1963, el comité ASCII (que incluía al menos a un miembro del comité Fieldata, WF Leubbert) publicó el primer código ASCII (X3.4-1963), que solucionó la mayoría de las deficiencias de Fieldata mediante un código más simple de siete bits. Muchos de los cambios fueron sutiles, como conjuntos de caracteres intercalables dentro de ciertos rangos numéricos. ASCII63 fue un éxito, ampliamente adoptado por la industria, y con la publicación posterior del código ASCII de 1967 (que añadió letras minúsculas y corrigió algunos problemas del "código de control"), ASCII67 se adoptó de forma bastante generalizada. El carácter estadounidense de ASCII67 se abordó en cierta medida en el estándar europeo ECMA-6 . [ 7 ] Las codificaciones ASCII extendidas de ocho bits , como varias extensiones de proveedores y la serie ISO/IEC 8859 , admitían todos los caracteres ASCII, así como caracteres no ASCII adicionales.
En la década de 1980, al intentar desarrollar codificaciones de caracteres universalmente intercambiables, los investigadores se enfrentaron al dilema de que, por un lado, parecía necesario añadir más bits para acomodar caracteres adicionales, pero, por otro lado, para los usuarios del conjunto de caracteres relativamente pequeño del alfabeto latino (que aún constituían la mayoría de los usuarios de computadoras), esos bits adicionales representaban un desperdicio colosal de recursos informáticos entonces escasos y costosos (ya que siempre se pondrían a cero para dichos usuarios). En 1985, el disco duro del usuario promedio de una computadora personal podía almacenar solo unos 10 megabytes y costaba aproximadamente 250 dólares estadounidenses en el mercado mayorista (y mucho más si se compraba por separado en una tienda minorista), [ 8 ] por lo que era muy importante en ese momento hacer que cada bit contara.
La solución de compromiso que finalmente se encontró y se desarrolló en Unicode consistió en romper con la suposición (que se remonta a los códigos telegráficos) de que cada carácter debía corresponder siempre directamente a una secuencia de bits específica. En cambio, los caracteres se asignarían primero a una representación intermedia universal en forma de números abstractos llamados puntos de código . Estos puntos de código se representarían de diversas maneras y con diferentes números predeterminados de bits por carácter (unidades de código) según el contexto. Para codificar puntos de código superiores a la longitud de la unidad de código, como por ejemplo superiores a 256 para unidades de ocho bits, la solución fue implementar codificaciones de longitud variable, donde una secuencia de escape indicaría que los bits subsiguientes debían interpretarse como un punto de código superior.
Terminología
Los diversos términos relacionados con la codificación de caracteres se utilizan a menudo de forma inconsistente o incorrecta. [ 9 ] Históricamente, un mismo estándar especificaba un repertorio de caracteres y cómo debían codificarse en una secuencia de unidades de código, generalmente con un solo carácter por unidad. Sin embargo, debido al surgimiento de codificaciones de caracteres más sofisticadas, la distinción entre términos se ha vuelto importante.
Personaje
Un carácter es la unidad más pequeña de texto que tiene valor semántico. [ 9 ] [ 10 ] En lingüística , esto se llama grafema y cada una de las diversas formas en que se puede escribir se llama glifo . (Por ejemplo, la forma con serifa g y la forma sin serifa g son cada una un glifo del grafema ⟨ g ⟩ , U+0067 g LETRA MINÚSCULA LATINA G .)
Lo que constituye un carácter varía según la codificación de caracteres. Por ejemplo, para las letras con diacríticos , existen dos enfoques distintos para codificarlas. Se pueden codificar como un único carácter unificado (conocido como carácter precompuesto) o como caracteres separados que se combinan en un solo glifo . El primero simplifica el sistema de manejo de texto, pero el segundo permite usar cualquier combinación de letra/diacrítico en el texto. Las ligaduras plantean problemas similares. Algunos sistemas de escritura, como el árabe y el hebreo, tienen grafemas cuya forma y unión dependen del contexto.
Conjunto de caracteres
Un conjunto de caracteres es una colección de caracteres que se utilizan para representar texto. [ 9 ] [ 10 ] Por ejemplo, el alfabeto latino y el alfabeto griego son conjuntos de caracteres.
Conjunto de caracteres codificados
Un conjunto de caracteres codificado es un conjunto de caracteres en el que cada elemento está asignado de forma única a un valor numérico. [ 10 ]
Esto también se conoce como página de códigos , [ 9 ] aunque ese término está generalmente en desuso. Originalmente, página de códigos se refería a un número de página en un manual de IBM que definía una codificación de caracteres particular. [ 11 ] Otros proveedores, incluidos Microsoft , SAP y Oracle Corporation , también publicaron sus propias páginas de códigos, incluidas las notables páginas de códigos de Windows y la página de códigos 437. A pesar de que ya no se hace referencia a páginas específicas en un manual, muchas codificaciones de caracteres todavía se identifican con el mismo número. De igual manera, el término página de códigos todavía se usa para referirse a la codificación de caracteres.
En los sistemas Unix y similares , se suele utilizar el término charmap , normalmente en el contexto más amplio de las configuraciones regionales.
La arquitectura de representación de datos de caracteres (CDRA) de IBM designa cada entidad con un identificador de conjunto de caracteres codificado (CCSID) , que se denomina indistintamente conjunto de caracteres , página de códigos o CHARMAP . [ 12 ]
Repertorio de personajes
Un repertorio de caracteres es un conjunto de caracteres que pueden representarse mediante un conjunto de caracteres codificados específico. [ 10 ] [ 13 ] El repertorio puede ser cerrado, lo que significa que no se permiten adiciones sin crear un nuevo estándar (como ocurre con ASCII y la mayor parte de la serie ISO-8859); o puede ser abierto, permitiendo adiciones (como ocurre con Unicode y, en cierta medida, con las páginas de códigos de Windows ). [ 13 ]
Punto de código
Un punto de código es el valor o la posición de un carácter en un conjunto de caracteres codificados. [ 10 ] Un punto de código se representa mediante una secuencia de unidades de código. La asignación se define mediante la codificación. Por lo tanto, el número de unidades de código necesarias para representar un punto de código depende de la codificación:
- UTF-8: los puntos de código se corresponden con una secuencia de una, dos, tres o cuatro unidades de código.
- UTF-16: las unidades de código son el doble de largas que las unidades de código de 8 bits. Por lo tanto, cualquier punto de código con un valor escalar menor que U+10000 se codifica con una sola unidad de código. Los puntos de código con un valor U+10000 o superior requieren dos unidades de código cada uno. Estos pares de unidades de código tienen un término único en UTF-16: "pares sustitutos Unicode".
- UTF-32: la unidad de código de 32 bits es lo suficientemente grande como para que cada punto de código se represente como una sola unidad de código.
- GB 18030: Es común el uso de múltiples unidades de código por punto de código, debido a las pequeñas unidades de código. Los puntos de código se asignan a una, dos o cuatro unidades de código. [ 14 ]
Espacio de código
El espacio de código es el rango de valores numéricos abarcado por un conjunto de caracteres codificados. [ 10 ] [ 12 ]
Unidad de código
Una unidad de código es la combinación mínima de bits que puede representar un carácter en una codificación de caracteres (en términos informáticos , es el tamaño de palabra de la codificación de caracteres). [ 10 ] [ 12 ] Las unidades de código comunes incluyen 7 bits, 8 bits, 16 bits y 32 bits. En algunas codificaciones, algunos caracteres se codifican como múltiples unidades de código .
Por ejemplo:
Codificación Unicode
Unicode y su estándar paralelo, el Conjunto Universal de Caracteres ISO/IEC 10646 , constituyen un estándar unificado para la codificación de caracteres. En lugar de asignar caracteres directamente a bytes , Unicode define por separado un conjunto de caracteres codificados que asigna caracteres a números naturales únicos ( puntos de código ), cómo se asignan esos puntos de código a una serie de números naturales de tamaño fijo (unidades de código) y, finalmente, cómo se codifican esas unidades como una secuencia de octetos (bytes). El propósito de esta descomposición es establecer un conjunto universal de caracteres que pueda codificarse de diversas maneras. Para describir el modelo con precisión, Unicode utiliza términos existentes y define otros nuevos. [ 12 ]
Repertorio de personajes abstractos
Un repertorio de caracteres abstractos (ACR, por sus siglas en inglés) es el conjunto completo de caracteres abstractos que admite un sistema. Unicode tiene un repertorio abierto, lo que significa que se añadirán nuevos caracteres al repertorio con el tiempo.
Conjunto de caracteres codificados
Un conjunto de caracteres codificados (CCS) es una función que asigna caracteres a puntos de código (cada punto de código representa un carácter). Por ejemplo, en un repertorio determinado, la letra mayúscula "A" del alfabeto latino podría estar representada por el punto de código 65, la letra "B" por el 66, y así sucesivamente. Varios conjuntos de caracteres codificados pueden compartir el mismo repertorio; por ejemplo, las páginas de códigos 037 y 500 de ISO/IEC 8859-1 e IBM cubren el mismo repertorio, pero lo asignan a diferentes puntos de código.
Formato de codificación de caracteres
Los sistemas de hardware y software suelen tener una longitud de palabra "nativa" máxima, como 16 o 32 bits. Una codificación de caracteres puede definir puntos de código cuya longitud exceda la longitud de palabra nativa del sistema. Una forma de codificación de caracteres (FCC) es la asignación de puntos de código a unidades de código que dividen un punto de código de forma estandarizada, de modo que cada unidad de código se ajuste a la longitud de palabra del sistema. Por ejemplo, un ordenador que representa números en unidades de 16 bits solo puede representar puntos de código de hasta 65 535 por unidad, pero se pueden representar puntos de código más grandes utilizando varias unidades de 16 bits, según lo define la FCC.
Esquema de codificación de caracteres
Un esquema de codificación de caracteres (CES) es la asignación de unidades de código a una secuencia de octetos para facilitar el almacenamiento en un sistema de archivos basado en octetos o la transmisión a través de una red basada en octetos. Los esquemas de codificación de caracteres simples incluyen UTF-8 , UTF-16BE , UTF-32BE , UTF-16LE y UTF-32LE ; los esquemas de codificación de caracteres compuestos, como UTF-16 , UTF-32 e ISO/IEC 2022 , cambian entre varios esquemas simples mediante una marca de orden de bytes o secuencias de escape ; los esquemas de compresión intentan minimizar la cantidad de bytes utilizados por unidad de código (como SCSU y BOCU ).
Aunque UTF-32BE y UTF-32LE son secuencias de caracteres de extensión más sencillas, la mayoría de los sistemas que trabajan con Unicode utilizan UTF-8 , que es compatible con versiones anteriores de ASCII de longitud fija y asigna puntos de código Unicode a secuencias de octetos de longitud variable, o UTF-16BE , que es compatible con versiones anteriores de UCS-2BE de longitud fija y asigna puntos de código Unicode a secuencias de palabras de 16 bits de longitud variable. Consulte la comparación de codificaciones Unicode para obtener información detallada.
Protocolo de nivel superior
Puede existir un protocolo de nivel superior que proporcione información adicional para seleccionar la variante específica de un carácter Unicode , especialmente cuando existen variantes regionales que se han unificado en Unicode como el mismo carácter. Un ejemplo es el atributo XML xml:lang.
El modelo Unicode utiliza el término "mapa de caracteres" para otros sistemas que asignan directamente una secuencia de caracteres a una secuencia de bytes, cubriendo todas las capas CCS, CEF y CES. [ 12 ]
Documentación de puntos de código
Un carácter se documenta comúnmente como 'U+' seguido de su valor de punto de código en hexadecimal . El rango de puntos de código válidos (el espacio de código) para el estándar Unicode es de U+0000 a U+10FFFF, ambos inclusive, dividido en 17 planos , identificados por los números del 0 al 16. Los caracteres en el rango de U+0000 a U+FFFF están en el plano 0, llamado Plano Multilingüe Básico (BMP). Este plano contiene los caracteres más utilizados. Los caracteres en el rango de U+10000 a U+10FFFF en los otros planos se denominan caracteres suplementarios .
La siguiente tabla incluye ejemplos de puntos de código:
Ejemplo
Consideremos "ab̲c𐐀" , una cadena que contiene un carácter combinado Unicode ( U+0332 ◌ ̲ LÍNEA BAJA DE COMBINACIÓN para subrayar la ⟨b⟩ ) y un carácter suplementario ( U+10400 𐐀 LETRA CAPITAL DESERET LONG I ). Esta cadena tiene varias representaciones Unicode que son lógicamente equivalentes, pero cada una se adapta a un conjunto diverso de circunstancias o rango de requisitos :
- Cuatro caracteres compuestos :
a,b̲,c,𐐀
- Cinco grafemas:
a,b,_,c,𐐀
- Cinco puntos de código Unicode :
U+0061,U+0062,U+0332,U+0063,U+10400
- Cinco unidades de código UTF-32 (valores enteros de 32 bits):
0x00000061,0x00000062,0x00000332,0x00000063,0x00010400
- Seis unidades de código UTF-16 (enteros de 16 bits)
0x0061,0x0062,0x0332,0x0063,0xD801,0xDC00
- Nueve unidades de código UTF-8 (valores de 8 bits o bytes )
0x61,0x62,0xCC,0xB2,0x63,0xF0,0x90,0x90,0x80
Cabe destacar que 𐐀 se representa con un valor de 32 bits (UTF-32), dos valores de 16 bits (UTF-16) o cuatro valores de 8 bits (UTF-8). Si bien cada una de estas formas utiliza el mismo número total de bits (32) para representar el grafema, no resulta evidente la relación entre los valores numéricos de los bytes.
Transcodificación
Para dar soporte a entornos que utilizan múltiples codificaciones de caracteres, se ha desarrollado software para traducir texto entre diferentes esquemas de codificación de caracteres, un proceso conocido como transcodificación . Algunos ejemplos de software destacados son:
- Navegador web : los navegadores modernos cuentan con detección automática de codificación de caracteres.
- iconv – Programa y API estandarizada para convertir codificaciones
- luit – Programa que convierte la codificación de entrada y salida en programas que se ejecutan de forma interactiva.
- Componentes internacionales para Unicode : un conjunto de bibliotecas C y Java para la conversión de conjuntos de caracteres.
- Encoding.Convert – API de .NET [ 15 ]
- MultiByteToWideChar/WideCharToMultiByte: funciones de la API de Windows para convertir entre ANSI y Unicode [ 16 ] [ 17 ]
Codificaciones de caracteres comunes
La codificación de caracteres más utilizada en la web es UTF-8 , presente en el 98,9% de los sitios web analizados, según datos de enero de 2026. . [ 2 ] En programas de aplicación y tareas del sistema operativo , tanto UTF-8 como UTF-16 son opciones populares. [ 3 ] [ 18 ]
- ISO 646
- EBCDIC
- ISO 8859 :
- ISO 8859-1 Europa Occidental
- ISO 8859-2 Europa Occidental y Central
- ISO 8859-3 Europa Occidental y Europa Meridional (turco, maltés y esperanto)
- ISO 8859-4 Europa Occidental y países bálticos (Lituania, Estonia, Letonia y Laponia)
- Alfabeto cirílico ISO 8859-5
- ISO 8859-6 árabe
- ISO 8859-7 Griego
- Hebreo ISO 8859-8
- ISO 8859-9 Europa Occidental con conjunto de caracteres turcos modificado
- ISO 8859-10 Europa Occidental con conjunto de caracteres racionalizado para lenguas nórdicas, incluido el conjunto completo de caracteres islandeses.
- ISO 8859-11 tailandés
- ISO 8859-13 Idiomas bálticos más polaco
- ISO 8859-14 Lenguas celtas (gaélico irlandés, escocés, galés)
- ISO 8859-15 Añadió el símbolo del euro y otras racionalizaciones a la norma ISO 8859-1.
- ISO 8859-16 Idiomas de Europa central, oriental y meridional (albanés, bosnio, croata, húngaro, polaco, rumano, serbio y esloveno, pero también francés, alemán, italiano y gaélico irlandés)
- CP437 , CP720, CP737 , CP850 , CP852, CP855, CP857, CP858 , CP860, CP861 , CP862 , CP863 , CP865 , CP866 , CP869 , CP872
- Conjuntos de caracteres de MS-Windows :
- Windows-1250 para idiomas de Europa Central que utilizan el alfabeto latino (polaco, checo, eslovaco, húngaro, esloveno, serbio, croata, bosnio, rumano y albanés).
- Windows-1251 para alfabetos cirílicos
- Windows-1252 para idiomas occidentales
- Windows-1253 para griego
- Windows-1254 para turco
- Windows-1255 para hebreo
- Windows-1256 para árabe
- Windows-1257 para idiomas bálticos
- Windows-1258 para vietnamita
- Mac OS Roman
- KOI8-R , KOI8-U , KOI-7
- MIK
- ISCII
- TSCII
- VISCII
- JIS X 0208 es un estándar ampliamente utilizado para la codificación de caracteres japoneses que cuenta con varias formas de codificación.
- Shift JIS ( la página 932 del Código de Microsoft es un dialecto de Shift_JIS)
- EUC-JP
- ISO-2022-JP
- La norma JIS X 0213 es una versión extendida de la norma JIS X 0208.
- guobiao chino
- Taiwan Big5 (una variante más famosa es Microsoft Code página 950 )
- Hong Kong HKSCS
- coreano
- KS X 1001 es un estándar coreano de codificación de caracteres de doble byte.
- EUC-KR
- ISO-2022-KR
- Unicode (y sus subconjuntos, como el "Plano Multilingüe Básico" de 16 bits)
- ANSEL o ISO/IEC 6937
Véase también
- Codificación porcentual : método para codificar caracteres en una URI.
- Código Alt – Método de entrada
- Codificaciones de caracteres en HTML : uso de sistemas de codificación para caracteres internacionales en HTML
- Análisis de conjuntos de caracteres : práctica de deducir el tipo de archivo de un flujo de bits. Páginas que muestran descripciones breves de destinos de redirección.
- Categoría: Codificación de caracteres – artículos relacionados con la codificación de caracteres en general
- Categoría: Conjuntos de caracteres – artículos que detallan codificaciones de caracteres específicas
- Hexadecimal – Representación numérica en base 16
- Mojibake : texto ilegible como resultado de codificaciones de caracteres incorrectas.
- Mojikyō – Esquema de codificación de caracteres
- Capa de presentación : capa del modelo OSI para la traducción de datos.
- Tofu (símbolo) : Marca que se muestra cuando no se puede resolver un punto de código.
- .notdef , un carácter dentro de una fuente que se utilizará para este propósito.
- TRON (codificación) – Codificación de caracteres multibyte
- Caracteres del conjunto de caracteres universal (Universal Character Set) : lista completa de los caracteres disponibles en la mayoría de los ordenadores.
Referencias
- ↑ "Definición de codificación de caracteres" . Diccionario de términos técnicos . 24 de septiembre de 2010.
- 1 2 "Encuesta de uso de codificaciones de caracteres desglosada por clasificación" . W3Techs . Consultado el 1 de enero de 2026 .
- 1 2 "Charset" . Desarrolladores de Android . Consultado el 2 de enero de 2021.
Nota de Android: La plataforma Android siempre utiliza UTF-8 por defecto.
- ↑ Tom Henderson (17 de abril de 2014). "Tablas de códigos de caracteres de computadoras antiguas y por qué siguen siendo relevantes" . Smartbear. Archivado del original el 30 de abril de 2014. Recuperado el 29 de abril de 2014 .
- ↑ "Manual preliminar de información de las máquinas de procesamiento electrónico de datos IBM tipo 702" (PDF) . 1954. pág. 80. 22-6173-1. Archivado (PDF) del original el 9 de octubre de 2022 – vía bitsavers.org.
- ↑ "Sistema UNIVAC" (PDF) (ficha de referencia).
- ↑ Tom Jennings (20 de abril de 2016). "Una historia anotada de algunos códigos de caracteres" . Sensitive Research . Recuperado el 1 de noviembre de 2018 .
- ↑ Strelho, Kevin (15 de abril de 1985). "IBM impulsa los discos duros hacia nuevos estándares" . InfoWorld . Popular Computing Inc. págs. 29–33 . Recuperado el 10 de noviembre de 2020 .
- 1 2 3 4 Shawn Steele (15 de marzo de 2005). "¿Cuál es la diferencia entre una codificación, una página de códigos, un conjunto de caracteres y Unicode?" . Microsoft Docs .
- 1 2 3 4 5 6 7 "Glosario de términos Unicode" . Consorcio Unicode.
- ↑ "Información del programador del terminal de vídeo VT510" . Digital Equipment Corporation (DEC). 7.1. Conjuntos de caracteres - Descripción general. Archivado del original el 26 de enero de 2016. Recuperado el 15 de febrero de 2017.
Además de los conjuntos de caracteres tradicionales
de DEC
e
ISO
, que se ajustan a la estructura y las reglas de
ISO 2022
, el
VT510
admite varias páginas de códigos de IBM PC (
números de página
en el manual del conjunto de caracteres estándar de IBM) en modo
PCTerm
para emular el
terminal de consola
de los PC estándar de la industria.
- 1 2 3 4 5 Whistler, Ken; Freytag, Asmus (11 de noviembre de 2022). "UTR#17: Modelo de codificación de caracteres Unicode" . Consorcio Unicode . Recuperado el 12 de agosto de 2023 .
- 1 2 «Capítulo 3: Conformidad». El estándar Unicode versión 15.0 – Especificación principal (PDF) . Consorcio Unicode. Septiembre de 2022. ISBN 978-1-936213-32-0.
- ↑ "Terminología (Los tutoriales de Java)" . Oracle . Consultado el 25 de marzo de 2018 .
- ↑ "Método Encoding.Convert" . Biblioteca de clases de Microsoft .NET Framework .
- ↑ "Función MultiByteToWideChar (stringapiset.h)" . Documentación de Microsoft . 13 de octubre de 2021.
- ↑ "Función WideCharToMultiByte (stringapiset.h)" . Documentación de Microsoft . 9 de agosto de 2022.
- ↑ Galloway, Matt (9 de octubre de 2012). "Codificación de caracteres para desarrolladores de iOS. ¿O UTF-8 ahora qué?" . Matt Galloway . Recuperado el 2 de enero de 2021.
En realidad, normalmente se asume UTF-8, ya que es, con mucho, la codificación más común.
Lecturas adicionales
- Mackenzie, Charles E. (1980). Conjuntos de caracteres codificados, historia y desarrollo (PDF) . Serie de programación de sistemas (1.ª ed.). Addison-Wesley Publishing Company, Inc. ISBN 978-0-201-14460-4LCCN 77-90165 . Archivado (PDF) del original el 26 de mayo de 2016. Consultado el 25 de agosto de 2019 .
Enlaces externos
- Conjuntos de caracteres registrados por la Autoridad de Números Asignados de Internet (IANA)
- Caracteres y codificaciones , por Jukka Korpela
- Informe técnico Unicode n.º 17: Modelo de codificación de caracteres
- Códigos de caracteres decimales y hexadecimales en HTML Unicode – Convertidor de codificación
- Lo mínimo indispensable que todo desarrollador de software debe saber sobre Unicode y conjuntos de caracteres (¡Sin excusas!) por Joel Spolsky (10 de octubre de 2003)
- Codificación de caracteres
- Tipografía digital
- Lenguaje natural e informática