ISO/IEC 8859-1 , comúnmente conocido como Latin-1 , es una codificación de caracteres de la serie ISO/IEC 8859 de codificaciones de caracteres estándar basadas en ASCII . Codifica 191 caracteres del alfabeto latino . Es la base de muchos conjuntos de caracteres populares de 8 bits y del segundo bloque de caracteres de Unicode , el Suplemento Latin-1 . Se utiliza en toda América , Europa Occidental , Oceanía y gran parte de África .
Es la codificación de caracteres de un solo byte más declarada para páginas web ; sin embargo, según el estándar HTML5 , [ 1 ] los navegadores web la interpretan como el superconjunto Windows-1252 , por lo que estos documentos pueden incluir caracteres de ese conjunto.
ISO-8859-1 es el nombre preferido de la Autoridad de Números Asignados de Internet (IANA) para este estándar cuando se complementa con los códigos de control C0 y C1 de ISO/IEC 6429. Se han registrado los siguientes alias: iso-ir-100 , csISOLatin1 , latin1 , l1 , IBM819 , la página de códigos 28591 , también conocida como Windows-28591 , se utiliza para ello en Windows. [ 2 ] IBM lo llama página de códigos 819 o CP819 ( CCSID 819 ). [ 3 ] [ 4 ] [ 5 ] [ 6 ] Oracle lo llama WE8ISO8859P1 . [ 7 ]
Cobertura
La codificación tiene cobertura suficiente para las letras de muchos idiomas:
Lenguas modernas con cobertura completa del alfabeto.
Notas
- ↑ Ortografía clásica básica
- ↑ Escritura de Rumi
- ↑ Bokmål y Nynorsk
- ↑ Europeo y brasileño
Idiomas con cobertura incompleta
La norma ISO-8859-1 se utilizaba comúnmente para ciertos idiomas, aunque carecía de caracteres propios de estos. En la mayoría de los casos, solo faltaban unas pocas letras o estas se usaban con poca frecuencia, y podían sustituirse por caracteres incluidos en la ISO-8859-1 mediante algún tipo de aproximación tipográfica . La siguiente tabla enumera dichos idiomas.
La letra ÿ , que aparece en francés muy raramente, principalmente en nombres de ciudades como L'Haÿ-les-Roses y nunca al principio de las palabras, se incluye únicamente en minúscula. El espacio correspondiente a su mayúscula lo ocupa la letra ß minúscula del alemán, que no tenía mayúscula cuando se creó la norma.
Personajes desaparecidos
Al igual que todas las codificaciones ISO-8859 y ASCII, carece de símbolos necesarios para una tipografía atractiva y correcta:
- Solo se incluyen las comillas « » , " " y ' ' . Faltan las comillas curvas, así como las comillas simples y las comillas angulares utilizadas por algunos idiomas compatibles. También falta el apóstrofo curvado.
- El símbolo del euro se presentó al público por primera vez el 12 de diciembre de 1996. [ 8 ] Debido a que este conjunto de caracteres se introdujo en 1987, no lo incluye.
- Faltan el guion corto y el guion largo .
Windows-1252 añadió todos estos caracteres, e ISO/IEC 8859-15 añadió el símbolo del euro.
Historia
ISO 8859-1 se basó en el Conjunto de Caracteres Multinacionales (MCS) utilizado por Digital Equipment Corporation (DEC) en el popular terminal VT220 en 1983. Fue desarrollado dentro de la Asociación Europea de Fabricantes de Computadoras (ECMA) y publicado en marzo de 1985 como ECMA-94 , [ 9 ] nombre por el cual todavía se le conoce a veces.
El borrador original de ISO 8859-1 ubicaba las letras francesas Œ y œ en los puntos de código 215 (0xD7) y 247 (0xF7), como en el MCS. Sin embargo, el delegado de Francia, que no era ni lingüista ni tipógrafo, afirmó falsamente que estas no son letras francesas independientes, sino meras ligaduras (como fi o fl ), con el apoyo del equipo de delegados de Bull Publishing Company , que en ese momento no imprimía habitualmente francés con Œ / œ en su estilo de casa. Un delegado angloparlante de Canadá insistió en mantener Œ / œ , pero fue rechazado por el delegado francés y el equipo de Bull. Estos puntos de código pronto se llenaron con × y ÷ por sugerencia de la delegación alemana. El apoyo al francés se redujo aún más cuando se afirmó falsamente que la letra ÿ "no es francesa", lo que resultó en la ausencia de la mayúscula Ÿ . De hecho, la letra ÿ se encuentra en varios nombres propios franceses, y la letra mayúscula se ha utilizado en diccionarios y enciclopedias. [ 10 ] Estos caracteres se añadieron a la norma ISO/IEC 8859-15:1999 . BraSCII coincide con el borrador original.
En 1985, Commodore adoptó ECMA-94 para su nuevo sistema operativo AmigaOS . [ 11 ] La impresora matricial de impacto Seikosha MP-1300AI, utilizada con el Amiga 1000, incluía esta codificación.
La segunda edición de ECMA-94 (junio de 1986) [ 12 ] también incluyó ISO 8859-2 , ISO 8859-3 e ISO 8859-4 como parte de la especificación.
La primera edición de la norma ISO se publicó en 1987 (la más reciente se publicó en 1998). Su título es Tecnología de la información: conjuntos de caracteres gráficos codificados en un solo byte de 8 bits : Parte 1: Alfabeto latino n.° 1 .
En 1990, la primera versión de Unicode utilizó los puntos de código de ISO-8859-1 como los primeros 256 puntos de código Unicode.
En 1992, la IANA registró el mapa de caracteres ISO_8859-1:1987 , más conocido por su nombre MIME preferido ISO-8859-1 (nótese el guion adicional sobre ISO 8859-1), un superconjunto de ISO 8859-1, para su uso en Internet . Este mapa asigna los códigos de control C0 y C1 a los valores de código no asignados, lo que permite representar 256 caracteres mediante cada posible valor de 8 bits.
Diseño de página de código
Uso de la web
ISO-8859-1 era (al menos según el estándar) la codificación predeterminada de los documentos entregados a través de HTTP con un tipo MIME que comenzaba con text/, la codificación predeterminada de los valores de ciertos encabezados HTTP descriptivos, y definía el repertorio de caracteres permitidos en los documentos HTML 3.2. Está especificada por muchos otros estándares. En la práctica, la codificación de superconjunto Windows-1252 es la más probable como predeterminada efectiva y es cada vez más común que UTF-8 funcione independientemente de si un estándar la especifica o no.
A partir de abril de 2026 El 6,7% de las páginas web estáticas se sirven con ISO/IEC 8859-1 , y con su superconjunto Windows-1252 se utiliza para el 9,3% de las páginas estáticas (e incluso más en algunos subtipos o categorías, véase más abajo). Esto contrasta mucho con el 0,9% de todos los sitios web que utilizan ISO/IEC 8859-1 (explicado por el hecho de que la mayoría de los sitios web se sirven programáticamente, generalmente con una mezcla de páginas estáticas). [ 13 ] [ 14 ] Es la codificación de caracteres de un solo byte más declarada, pero como los navegadores web y el estándar HTML5 [ 1 ] los interpretan como el superconjunto Windows-1252 , estos documentos pueden incluir caracteres de ese conjunto. Algunos países o idiomas muestran un uso mayor que el promedio mundial, en Brasil en 2025 según el uso de sitios web, el uso es del 2,2%, [ 15 ] y en Alemania del 2,1%. [ 16 ] [ 17 ]
HTML5 es el estándar más reciente que utilizan casi todas las páginas web, pero con respecto a los estándares más antiguos: el 14,0% de las páginas web HTML Transitional utilizan ISO-8859-1 [ 18 ] (HTML Transitional es utilizado por el 2,9% de todos los sitios web [ 19 ] ). HTML Strict tiene un uso del 17,0% [ 20 ] (aunque cabe señalar que HTML Strict solo es utilizado por el 0,1% de los sitios web [ 21 ] ). Para los sitios web que utilizan el elemento de sitio frameset obsoleto y poco utilizado (0,2% del total), el 24,7% de ellos utilizan ISO 8859-1. [ 22 ] Por lo tanto, se puede decir que las codificaciones heredadas se utilizan más con tecnología antigua, y HTML5 elimina en gran medida su uso.
Conjuntos de caracteres similares
ISO/IEC 8859-15
ISO/IEC 8859-15 se desarrolló en 1999 como una actualización de ISO/IEC 8859-1. Proporciona algunos caracteres para texto en francés y finlandés y el símbolo del euro , que faltan en ISO/IEC 8859-1. Esto requirió la eliminación de algunos caracteres poco utilizados de ISO/IEC 8859-1, incluidos los símbolos de fracción y los diacríticos sin letra: ¤, ¦, ¨, ´, ¸, ¼, ½, y ¾. Irónicamente, tres de los caracteres recién agregados ( Œ, œ, y Ÿ) ya estaban presentes en el Conjunto de Caracteres Multinacionales (MCS) de DEC de 1983 , el predecesor de ISO/IEC 8859-1 (1987). Dado que sus puntos de código originales ahora se reutilizaban para otros propósitos, los caracteres tuvieron que reintroducirse bajo puntos de código diferentes y menos lógicos.
ISO-IR-204, una modificación menor (llamada página de código 61235 por FreeDOS ), [ 23 ] se registró en 1998, alterando ISO-8859-1 al reemplazar el signo de moneda universal ( ¤ ) con el signo del euro [ 24 ] (la misma sustitución realizada por ISO-8859-15).
Windows-1252
El popular conjunto de caracteres Windows-1252 añade todos los caracteres que faltan en la norma ISO/IEC 8859-15 , además de varios símbolos tipográficos, al reemplazar los controles C1, poco utilizados, en el rango 128 a 159 ( hexadecimal 80 a 9F). Es muy común que el texto en Windows-1252 se etiquete erróneamente como ISO-8859-1. Un resultado frecuente era que todas las comillas y apóstrofes (producidos por las " comillas inteligentes " en el software de procesamiento de texto) se reemplazaban por signos de interrogación o cuadros en sistemas operativos que no eran Windows, lo que dificultaba la lectura del texto. Muchos navegadores web y clientes de correo electrónico interpretan los códigos de control ISO-8859-1 como caracteres de Windows-1252, comportamiento que posteriormente se estandarizó en HTML5 . [ 25 ]
Mac Roman
El ordenador Apple Macintosh introdujo en 1984 una codificación de caracteres llamada Mac Roman. Estaba diseñada para la autoedición en Europa Occidental . Es un superconjunto de ASCII y contiene la mayoría de los caracteres de ISO-8859-1, además de todos los caracteres adicionales de Windows-1252, pero con una disposición totalmente diferente. Los pocos caracteres imprimibles que se encuentran en ISO/IEC 8859-1, pero no en este conjunto, suelen causar problemas al editar texto en sitios web con navegadores Macintosh antiguos, incluida la última versión de Internet Explorer para Mac .
Otro
DOS tiene la página de códigos 850 , que contiene todos los caracteres imprimibles que tiene ISO-8859-1, aunque en una disposición totalmente diferente, además de los caracteres gráficos más utilizados de la página de códigos 437 .
Entre 1989 [ 26 ] y 2015, Hewlett-Packard utilizó otro superconjunto de ISO-8859-1 en muchas de sus calculadoras. Este conjunto de caracteres propietario también se denominaba a veces simplemente "ECMA-94". [ 26 ] HP también tiene la página de códigos 1053 , que añade el tono medio (▒, U+2592) en 0x7F. [ 27 ]
Varias páginas de códigos EBCDIC fueron diseñadas expresamente para tener el mismo conjunto de caracteres que ISO-8859-1, para permitir una fácil conversión entre ellas.
Véase también
Referencias
- 1 2 "Codificación" . WHATWG . 27 de enero de 2015. sec. 5.2 Nombres y etiquetas. Archivado del original el 4 de febrero de 2015. Recuperado el 4 de febrero de 2015 .
- ↑ "Identificadores de página de códigos" . Microsoft Corporation . Consultado el 19 de diciembre de 2010 .
- ↑ "Documento informativo de la página 819 del código" . Archivado del original el 16 de enero de 2017.
- ↑ "Documento informativo CCSID 819" . Archivado del original el 27 de marzo de 2016.
- ↑ Página de códigos CPGID 00819 (pdf) (PDF) , IBM
- ↑ Página de códigos CPGID 00819 (txt) , IBM
- ↑ Baird, Cathy; Chiba, Dan; Chu, Winson; Fan, Jessica; Ho, Claire; Law, Simon; Lee, Geoff; Linsley, Peter; Matsuda, Keni; Oscroft, Tamzin; Takeda, Shige; Tanaka, Linus; Tozawa, Makoto; Trute, Barry; Tsujimoto, Mayumi; Wu, Ying; Yau, Michael; Yu, Tim; Wang, Chao; Wong, Simon; Zhang, Weiran; Zheng, Lei; Zhu, Yan; Moore, Valarie (2002) [1996]. "Apéndice A: Datos de localización". Guía de soporte de globalización de la base de datos Oracle9i (PDF) (ed. Versión 2 (9.2) ). Oracle Corporation . Oracle A96529-01. Archivado (PDF) del original el 14 de febrero de 2017. Recuperado el 14 de febrero de 2017 .
- ↑ "Tipógrafos debaten sobre el euro" . Evertype . Diciembre de 1996. Archivado del original el 22 de febrero de 2023. Consultado el 28 de abril de 2023 .
- 1 2 Estándar ECMA-94: Conjunto de caracteres gráficos codificados de un solo byte de 8 bits (PDF) (1.ª ed.). Asociación Europea de Fabricantes de Computadoras (ECMA). Marzo de 1985 [1984-12-14]. Archivado (PDF) del original el 2 de diciembre de 2016. Recuperado el 1 de diciembre de 2016. [
…] Desde 1982, la urgencia de la necesidad de un conjunto de caracteres codificados de un solo byte de 8 bits fue reconocida tanto en ECMA como en ANSI/X3L2 y se intercambiaron numerosos documentos de trabajo entre los dos grupos. En febrero de 1984, ECMA TC1 presentó a ISO/TC97/SC2 una propuesta para dicho conjunto de caracteres codificados. En su reunión de abril de 1984, SC decidió presentar a TC97 una propuesta para un nuevo elemento de trabajo sobre este tema. Las discusiones técnicas durante y después de esta reunión llevaron a TC1 a adoptar el esquema de codificación propuesto por X3L2. La Parte 1 del Proyecto de Norma Internacional DTS 8859 se basa en esta propuesta conjunta ANSI/ECMA. […] Fue adoptada como Norma ECMA por la Asamblea General los días 13 y 14 de diciembre de 1984. […]
- ^ André, Jacques (1996). "ISO Latin-1, norma de codificación de caracteres europeos? ¡Tres caracteres franceses en sont absents!" (PDF) . Cahiers GUTenberg (en francés) (25): 65– 77. doi : 10.5802/cg.205 .
- ↑ Malyshev, Michael (10 de enero de 2003). "Registro de nuevo conjunto de caracteres [ Amiga-1251 ] " . ATO-RU (Organización de Traducción de Amiga - Departamento de Ruso). Archivado del original el 5 de diciembre de 2016. Recuperado el 5 de diciembre de 2016 .
- ↑ "Segunda edición de ECMA-94 (junio de 1986)" (PDF) .
- ↑ "Tendencias históricas en las estadísticas de uso de codificaciones de caracteres para sitios web, diciembre de 2025" . W3Techs . Consultado el 17 de diciembre de 2025 .
- ↑ Cowan, John; Soltano, Sam (agosto de 2014). "¿Fuente de las estadísticas de codificación de caracteres?" . W3Techs .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan Brazil" . W3Techs . Consultado el 5 de febrero de 2026 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que usan .de" . W3Techs . Consultado el 5 de febrero de 2026 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan alemán" . W3Techs . Consultado el 16 de abril de 2025 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan HTML Transitional" . w3techs.com . Consultado el 10 de abril de 2026 .
- ↑ "Estadísticas de uso y cuota de mercado de HTML Transitional para sitios web, abril de 2026" . w3techs.com . Consultado el 10 de abril de 2026 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan HTML Strict" . w3techs.com . Consultado el 10 de abril de 2026 .
- ↑ "Estadísticas de uso y cuota de mercado de HTML Strict para sitios web, abril de 2026" . w3techs.com . Consultado el 10 de abril de 2026 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan Frameset" . w3techs.com . Consultado el 10 de abril de 2026 .
- ↑ "Cpi/CPIISO/Codepage.TXT en master · FDOS/Cpi" . GitHub .
- ↑ Estandarización de Tecnologías de la Información ITS (16-09-1998). Conjunto suplementario para la alternativa Latin-1 con el SIGNO EURO (PDF) . ITSCJ/ IPSJ . ISO-IR -204.
- ↑ van Kesteren, Anne (27 de enero de 2015). "5.2 Nombres y etiquetas" . Estándar de codificación . WHATWG . Archivado del original el 4 de febrero de 2015. Recuperado el 4 de febrero de 2015 .
- 1 2 Impresora infrarroja HP 82240B (1.ª ed.). Corvallis, OR, EE. UU.: Hewlett-Packard . Agosto de 1989. Número de pedido de HP: 82240-90014.
- ↑ "Página de código 1053" (PDF) . Archivado del original (PDF) el 21/01/2013.
Enlaces externos
- ISO/IEC 8859-1:1998
- ISO/IEC FDIS 8859-1:1998 — Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 1: Alfabeto latino n.° 1 (borrador con fecha del 12 de febrero de 1998, publicado el 15 de abril de 1998) . Archivado el 30 de septiembre de 2020 en Wayback Machine .
- Estándar ECMA-94: Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits — Alfabetos latinos n.° 1 a n.° 4, 2.ª edición (junio de 1986)
- ISO-IR 100 Parte derecha del alfabeto latino n.º 1 (1 de febrero de 1986)
- La base de datos de cartas
- Czyborra, Roman (1998-12-01). "La sopa de letras ISO 8859" . Archivado del original el 2016-12-01 . Recuperado el 2016-12-01 .
- ISO/IEC 8859
- Introducciones relacionadas con la informática en 1987
- Conjuntos de caracteres
- Normas ISO/IEC