ISO/IEC 8859 es una serie de normas técnicas para codificaciones de caracteres de 8 bits desarrolladas conjuntamente por la Organización Internacional de Normalización (ISO) y la Comisión Electrotécnica Internacional (IEC). Cada parte está numerada: ISO/IEC 8859-1 , ISO/IEC 8859-2 , etc. Hay 15 partes, excluyendo la abandonada ISO/IEC 8859-12 . [ 1 ] El grupo de trabajo de ISO que mantenía esta serie de normas se ha disuelto.
Las partes 1, 2, 3 y 4 de la norma ISO/IEC 8859 eran originalmente la norma internacional ECMA-94 .
Introducción
Si bien los patrones de bits de los 95 caracteres ASCII imprimibles son suficientes para intercambiar información en inglés moderno , la mayoría de los demás idiomas que utilizan alfabetos latinos necesitan símbolos adicionales que no están cubiertos por ASCII. La norma ISO/IEC 8859 buscó solucionar este problema utilizando el octavo bit de un byte de 8 bits para habilitar posiciones para otros 96 caracteres imprimibles. Las primeras codificaciones se limitaban a 7 bits debido a las restricciones de algunos protocolos de transmisión de datos y, en parte, por razones históricas. Sin embargo, se necesitaban más caracteres de los que cabían en una sola codificación de caracteres de 8 bits, por lo que se desarrollaron varias asignaciones, incluidas al menos diez adecuadas para diversos alfabetos latinos.
Las partes del estándar ISO/IEC 8859 solo definen caracteres imprimibles, aunque separan explícitamente los rangos de bytes 0x00–1F y 0x7F–9F como "combinaciones que no representan caracteres gráficos" (es decir, que están reservados para su uso como caracteres de control ) de acuerdo con ISO/IEC 4873 ; fueron diseñados para usarse junto con un estándar separado que defina las funciones de control asociadas con estos bytes, como ISO 6429 o ISO 6630. [ 2 ] Con este fin, una serie de codificaciones registradas con la IANA agregan el conjunto de control C0 (caracteres de control asignados a los bytes 0 a 31) de ISO 646 y el conjunto de control C1 (caracteres de control asignados a los bytes 128 a 159) de ISO 6429, lo que da como resultado mapas de caracteres completos de 8 bits con la mayoría, si no todos, los bytes asignados. Estos conjuntos tienen ISO-8859 -n como su nombre MIME preferido o, en los casos en que no se especifica un nombre MIME preferido, su nombre canónico. Mucha gente usa los términos ISO/IEC 8859- n e ISO-8859 -n indistintamente. A ISO/IEC 8859-11 no se le asignó un conjunto de caracteres de este tipo, presumiblemente porque era casi idéntico a TIS 620 .
Personajes
La norma ISO/IEC 8859 está diseñada para el intercambio fiable de información, no para la tipografía ; omite símbolos necesarios para una tipografía de alta calidad, como ligaduras opcionales, comillas curvas, guiones, etc. Como resultado, los sistemas de composición tipográfica de alta calidad suelen utilizar extensiones propietarias o idiosincrásicas además de las normas ASCII e ISO/IEC 8859, o bien utilizan Unicode .
Una regla aproximada basada en la experiencia práctica establece que si un carácter o símbolo no formaba parte de un conjunto de caracteres ampliamente utilizado para el procesamiento de datos y tampoco se incluía habitualmente en los teclados de las máquinas de escribir para un idioma nacional, no se incorporaba. Por lo tanto, se incluyeron las comillas dobles direccionales « y » utilizadas para algunos idiomas europeos, pero no las comillas dobles direccionales « y » utilizadas para el inglés y otros idiomas.
El francés no obtuvo sus ligaduras œ y Œ porque podían escribirse como 'oe'. Del mismo modo, Ÿ , necesaria para el texto en mayúsculas, también se eliminó. [ 3 ] [ 4 ] [ 5 ] Aunque bajo diferentes puntos de código, estos tres caracteres se reintrodujeron posteriormente con ISO/IEC 8859-15 en 1999, que también introdujo el nuevo símbolo del euro €. Del mismo modo, el neerlandés no obtuvo las letras ij e IJ , porque los hablantes de neerlandés se habían acostumbrado a escribirlas como dos letras separadas.
El rumano no obtuvo inicialmente sus letras Ș / ș y Ț / ț ( con coma ), porque estas letras fueron unificadas inicialmente con Ş / ş y Ţ / ţ ( con cedilla ) por el Consorcio Unicode , considerando que las formas con coma debajo eran variantes de glifos de las formas con cedilla. Sin embargo, las letras con coma explícita debajo se agregaron posteriormente al estándar Unicode y también están en ISO/IEC 8859-16 .
La mayoría de las codificaciones ISO/IEC 8859 proporcionan los signos diacríticos necesarios para varios idiomas europeos que utilizan el alfabeto latino. Otras proporcionan alfabetos no latinos: griego , cirílico , hebreo , árabe y tailandés . La mayoría de las codificaciones contienen solo caracteres de espaciado , aunque las de tailandés, hebreo y árabe también incluyen caracteres combinatorios .
El estándar no contempla los sistemas de escritura de las lenguas de Asia Oriental ( CJK ), ya que sus sistemas de escritura ideográficos requieren miles de puntos de código. Aunque utiliza caracteres latinos, el vietnamita tampoco cabe en 96 posiciones (sin usar diacríticos combinatorios como en Windows-1258 ). Cada alfabeto silábico japonés (hiragana o katakana, véase Kana ) cabría, como en JIS X 0201 , pero, al igual que otros alfabetos del mundo, no están codificados en el sistema ISO/IEC 8859.
Las partes de ISO/IEC 8859
La norma ISO/IEC 8859 se divide en las siguientes partes:
Cada parte de la norma ISO/IEC 8859 está diseñada para admitir idiomas que suelen tomar prestados caracteres entre sí, por lo que los caracteres que necesita cada idioma generalmente se incluyen en una sola parte. Sin embargo, existen algunas combinaciones de caracteres e idiomas que no se admiten sin transcripciones. Se hicieron esfuerzos para que las conversiones fueran lo más fluidas posible. Por ejemplo, el alemán tiene sus siete caracteres especiales en las mismas posiciones en todas las variantes latinas (1-4, 9, 10, 13-16), y en muchas posiciones los caracteres solo difieren en los diacríticos entre los conjuntos. En particular, las variantes 1-4 se diseñaron conjuntamente y tienen la propiedad de que cada carácter codificado aparece en una posición determinada o no aparece en absoluto.
Mesa
Puntos de código no asignados. Nuevas adiciones en las versiones ISO/IEC 8859-7:2003 e ISO/IEC 8859-8:1999 , previamente no asignadas.
Relación con Unicode y el UCS
Desde 1991, el Consorcio Unicode ha estado trabajando con ISO e IEC para desarrollar el Estándar Unicode e ISO/IEC 10646: el Conjunto Universal de Caracteres (UCS) en conjunto. Las ediciones más recientes de ISO/IEC 8859 expresan caracteres en términos de sus nombres Unicode/UCS y la notación U+nnnn , lo que hace que cada parte de ISO/IEC 8859 sea un esquema de codificación de caracteres Unicode/UCS que asigna un subconjunto muy pequeño del UCS a bytes individuales de 8 bits. Los primeros 256 caracteres en Unicode y el UCS son idénticos a los de ISO/IEC-8859-1 ( Latin-1 ).
Los conjuntos de caracteres de un solo byte, incluyendo partes de ISO/IEC 8859 y sus derivados, fueron los preferidos durante la década de 1990, debido a su buena consolidación y facilidad de implementación en software: la equivalencia de un byte con un carácter es simple y adecuada para la mayoría de las aplicaciones monolingües, y no existen caracteres combinables ni variantes. Con la generalización de los sistemas operativos compatibles con Unicode, ISO/IEC 8859 y otras codificaciones heredadas perdieron popularidad. Si bien aún persisten vestigios de ISO 8859 y modelos de caracteres de un solo byte en muchos sistemas operativos, lenguajes de programación, sistemas de almacenamiento de datos, aplicaciones de red, hardware de visualización y software de usuario final, la mayoría de las aplicaciones informáticas modernas utilizan Unicode internamente y recurren a tablas de conversión para mapear entre otras codificaciones cuando es necesario.
Estado actual
La norma ISO/IEC 8859 fue mantenida por el Comité Técnico Conjunto 1 de ISO/IEC, Subcomité 2, Grupo de Trabajo 3 (ISO/IEC JTC 1/SC 2/WG 3). En junio de 2004, el WG 3 se disolvió y las tareas de mantenimiento se transfirieron al SC 2. Actualmente, la norma no se está actualizando, ya que el único grupo de trabajo restante del Subcomité , el WG 2, se está concentrando en el desarrollo del Conjunto Universal de Caracteres Codificados (UCC) de Unicode .
El estándar de codificación WHATWG , que especifica las codificaciones de caracteres permitidas en HTML5 que los navegadores compatibles deben admitir, [ 12 ] incluye la mayor parte de ISO/IEC 8859, [ 13 ] excepto las partes 1, 9 y 11, que se interpretan como Windows-1252 , Windows-1254 y Windows-874 respectivamente. [ 14 ] Se instruye a los autores de nuevas páginas y a los diseñadores de nuevos protocolos a utilizar UTF-8 en su lugar. [ 14 ]
Véase también
- Lista de conjuntos de caracteres del sistema de información
- Formas numéricas
- Conjunto de caracteres RPL (un superconjunto ISO/IEC 8859-1 en calculadoras HP, también conocido como "ECMA-94")
- Conjunto de caracteres multinacionales (MCS) de DEC
- Conjunto Nacional de Caracteres de Reemplazo (NRCS) del DEC
Notas
- ↑ Faltan varias vocales acentuadas, incluidas Ǿ y ǿ . Estas pueden reemplazarse con vocales no acentuadas, aunque esto aumenta la ambigüedad.
- ↑ Las codificaciones ISO 8859 tratan IJ como un dígrafo. Otras codificaciones lo tratan como una letra.
- 1 2 Los caracteres que faltan están en ISO/IEC 8859-15.
- ↑ La edición de 1985 incluye únicamente una versión de ISO-8859-1.
- ↑ La edición de 1986 define KOI8-E , que es una codificación completamente diferente.
- ↑ 8859-5 carece de la letra Ґ/ґ , que fue reintroducida en el alfabeto ucraniano en 1990.
- ↑ Publicado en 1995, registrado en 1996. [ 11 ]
Referencias
- ↑ Chaudhuri, Arindam; Mandaviya, Krupa; Badelia, Pratixa; Ghosh, Soumya K. (24-12-2016), "Sistemas de reconocimiento óptico de caracteres para el idioma francés" , Sistemas de reconocimiento óptico de caracteres para diferentes idiomas con computación blanda , Cham: Springer International Publishing, pp. 109–136 , doi : 10.1007/978-3-319-50252-6_5 , ISBN 978-3-319-50251-9, consultado el 4 de diciembre de 2023
- ↑ ISO/IEC JTC 1/SC 2/WG 3 (1998-02-12). Texto final de DIS 8859-1, conjuntos de caracteres gráficos codificados de un solo byte de 8 bits—Parte 1: Alfabeto latino n.° 1 (PDF) . ISO / IEC FDIS 8859-1:1998; JTC1/SC2/N2988; WG3/N411.
Este conjunto de caracteres gráficos codificados puede considerarse una versión de un código de 8 bits según ISO/IEC 2022 o ISO/IEC 4873 en el nivel 1. [...] Las posiciones sombreadas en la tabla de códigos corresponden a combinaciones de bits que no representan caracteres gráficos. Su uso está fuera del alcance de ISO/IEC 8859; se especifica en otras normas internacionales, por ejemplo, ISO/IEC 6429.
{{citation}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Haralambous, Yannis (septiembre de 2007). Fuentes y codificaciones . Traducido por Horne, P. Scott (1.ª ed.). Sebastopol, California, EE. UU.: O'Reilly Media, Inc. págs. 37-38 . ISBN 978-0-596-10242-5Según una leyenda urbana, el delegado francés estaba de baja por
enfermedad el día en que se votó la norma y tuvo que recurrir a su homólogo belga. En realidad, el delegado francés era ingeniero y estaba convencido de que esta ligadura era inútil, por lo que los representantes suizos y alemanes presionaron para que se incluyeran los símbolos matemáticos × y ÷ en las posiciones donde lógicamente aparecerían Œ y œ .
- ^ André, Jacques (15 de octubre de 2003) [2 de octubre de 2003]. André, Bernardo; Barón, Georges-Louis; Bruillard, Éric (eds.). "Histoire d'Œ, histoire d'@ des rumeurs typographiques et de leurs enseignements" . Traitement de Texte et Production de Documents INRP/GEDIAPS (en francés): 19– 34. Archivado desde el original el 8 de diciembre de 2016 . Consultado el 9 de diciembre de 2016 .
- ^ André, Jacques (noviembre de 1996). "ISO Latin-1, norma de codificación de caracteres europeos? ¡Tres caracteres franceses en sont absents!" (PDF) . Cahiers GUTenberg (en francés) (25): 65– 77. Archivado desde el original (PDF) el 30 de noviembre de 2008.
- ↑ Everson, Michael. "Propuesta ISO 8859-12 (posteriormente 14)" .
- ↑ Czyborra, Roman (1997-10-12). "La sopa de letras ISO 8859" . Archivado del original el 2000-08-17.(Nota: Nota sobre "celta" en la antigua página de Czyborra).
- ↑ Jarnefors, Olle (11 de abril de 1996). "ISO-8859-10; registro de nuevos valores de conjunto de caracteres; error en el borrador MIME" . Instituto Real de Tecnología (KTH). Archivado del original el 4 de febrero de 2012.(Nota: Consulte la lista de correo de conjuntos de caracteres de la IETF sobre la próxima publicación de la parte estándar "Devanagari").
- ↑ "Resoluciones de la 12.ª Reunión de ISO/IEC JTC 1/SC 2/WG 3, Heraklion-Creta, Grecia, 4 de julio de 1997, 07" (PDF) . Heraklion-Creta, Grecia: ISO/IEC JTC 1/SC 2 N 2933, ISO/IEC JTC 1/SC 2/WG 3 N 401. 4 de julio de 1997. Archivado del original (PDF) el 7 de junio de 2011.
El Grupo de Trabajo 3 resuelve suspender cualquier actividad sobre este tema hasta que se obtenga un acuerdo general sobre la combinación de caracteres y hasta que se reciban las contribuciones adicionales.
- ↑ Czyborra, Roman (1998-12-01). "La sopa de letras ISO 8859" . Archivado del original el 2016-03-20.(Nota: Consulte la nota "ISCII" en la nueva página de Czyborra).
- ↑ Lazhintseva, Katya (1996-05-03). "Registro del nuevo conjunto de caracteres MIME: Windows-1257" . IANA.
- ↑ "8.2.2.3. Codificaciones de caracteres" . HTML 5.1, 2.ª edición . W3C .
Los agentes de usuario deben admitir las codificaciones definidas en el estándar de codificación WHATWG, incluidas, entre otras [...]
- ↑ van Kesteren, Ana . "Codificaciones heredadas de un solo byte" . Estándar de codificación . QUÉ WG .
- 1 2 van Kesteren, Anne . «Nombres y etiquetas» . Estándar de codificación . QUÉ WG .
Lecturas adicionales
- Las versiones publicadas de cada parte de ISO/IEC 8859 están disponibles, previo pago, en el sitio del catálogo de ISO y en la tienda web de IEC. Archivado el 12 de enero de 2015 en Wayback Machine .
- Las versiones en PDF de los borradores finales de algunas partes de la norma ISO/IEC 8859, tal como se presentaron al comité ISO/IEC JTC 1/SC 2/WG 3 para su revisión y publicación, están disponibles en el sitio web del Grupo de Trabajo 3 :
- ISO/IEC 8859-1:1998 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 1: Alfabeto latino n.º 1 (borrador del 12 de febrero de 1998, publicado el 15 de abril de 1998)
- ISO/IEC 8859-4:1998 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 4: Alfabeto latino n.º 4 (borrador del 12 de febrero de 1998, publicado el 1 de julio de 1998)
- ISO/IEC 8859-7:1999 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 7: Alfabeto latino/griego (borrador del 10 de junio de 1999; sustituido por ISO/IEC 8859-7:2003, publicado el 10 de octubre de 2003)
- ISO/IEC 8859-10:1998 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 10: Alfabeto latino n.º 6 (borrador del 12 de febrero de 1998, publicado el 15 de julio de 1998)
- ISO/IEC 8859-11:1999 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 11: Conjunto de caracteres latinos/tailandeses (borrador del 22 de junio de 1999; sustituido por ISO/IEC 8859-11:2001, publicado el 15 de diciembre de 2001)
- ISO/IEC 8859-13:1998 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 13: Alfabeto latino n.º 7 (borrador del 15 de abril de 1998, publicado el 15 de octubre de 1998)
- ISO/IEC 8859-15:1998 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 15: Alfabeto latino n.º 9 (borrador del 1 de agosto de 1997; sustituido por ISO/IEC 8859-15:1999, publicado el 15 de marzo de 1999)
- ISO/IEC 8859-16:2000 - Conjuntos de caracteres gráficos codificados de un solo byte de 8 bits, Parte 16: Alfabeto latino n.º 10 (borrador del 15 de noviembre de 1999; sustituido por ISO/IEC 8859-16:2001, publicado el 15 de julio de 2001)
- Las normas ECMA , que en teoría se corresponden exactamente con las normas del conjunto de caracteres ISO/IEC 8859, se pueden encontrar en:
- Estándar ECMA-94 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabetos latinos n.° 1 a n.° 4, 2.ª edición (junio de 1986)
- Estándar ECMA-113 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabeto latino/cirílico, 3.ª edición (diciembre de 1999)
- Estándar ECMA-114 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabeto latino/árabe, 2.ª edición (diciembre de 2000)
- Estándar ECMA-118 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabeto latino/griego (diciembre de 1986)
- Estándar ECMA-121 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabeto latino/hebreo, 2.ª edición (diciembre de 2000)
- Estándar ECMA-128 : Conjuntos de caracteres gráficos codificados en un solo byte de 8 bits - Alfabeto latino n.° 5, 2.ª edición (diciembre de 1999)
- Norma ECMA-144 : Conjuntos de caracteres codificados de un solo byte de 8 bits - Alfabeto latino n.º 6, 3.ª edición (diciembre de 2000)
- Las tablas de correspondencia entre ISO/IEC 8859-1 y Unicode , en formato de texto plano, se encuentran en el sitio FTP de Unicode.
- Las descripciones informales y los diagramas de códigos para la mayoría de las normas ISO/IEC 8859 están disponibles en ISO/IEC 8859 Alphabet Soup (Mirror).
- ISO/IEC 8859
- Conjuntos de caracteres
- Normas Ecma
- Normas ISO/IEC