Articulo de referencia

Conjuntos de caracteres latinos occidentales

Se diseñaron varios conjuntos de caracteres de 8 bits (codificaciones) para la representación binaria de lenguas comunes de Europa Occidental ( italiano , español , portugués , ...

Se diseñaron varios conjuntos de caracteres de 8 bits (codificaciones) para la representación binaria de lenguas comunes de Europa Occidental ( italiano , español , portugués , francés , alemán , neerlandés , inglés , danés , sueco , noruego e islandés ), que utilizan el alfabeto latino , algunas letras adicionales y otras con diacríticos precompuestos , algunos signos de puntuación y diversos símbolos (incluidas algunas letras griegas ). Estos conjuntos de caracteres también son compatibles con muchas otras lenguas, como el malayo , el suajili y el latín clásico .

Este material está técnicamente obsoleto, ya que ha sido reemplazado funcionalmente por Unicode . Sin embargo, sigue teniendo interés histórico.

Resumen

La serie de conjuntos de caracteres de 8 bits ISO-8859 codifica todos los conjuntos de caracteres latinos utilizados en Europa , si bien los mismos puntos de código tenían múltiples usos, lo que causaba algunas dificultades (incluidos caracteres ilegibles o distorsionados y problemas de comunicación). La llegada de Unicode , con un punto de código único para cada glifo , resolvió estos problemas.

Historia

La codificación ASCII ( Código Estándar Estadounidense para el Intercambio de Información ) de siete bits , utilizada anteriormente en Estados Unidos, solo contaba con caracteres suficientes para representar adecuadamente unos pocos idiomas, como el inglés, el latín, el malayo y el suajili. Carecía de algunas letras y combinaciones de letras y diacríticos presentes en otros idiomas con alfabeto latino. Sin embargo, dado que no existía otra opción en la mayoría de las plataformas informáticas estadounidenses, el uso de ASCII era inevitable, salvo en países con una sólida industria informática. Existía el conjunto de codificaciones ISO 646 , que sustituía algunos símbolos de ASCII por caracteres locales, pero el espacio era muy limitado y algunos de los símbolos sustituidos eran bastante comunes en lenguajes de programación, por ejemplo.

La mayoría de los ordenadores utilizaban internamente bytes de ocho bits, pero la comunicación (considerada inherentemente poco fiable) empleaba siete bits de datos más un bit de paridad . Con el tiempo, se generalizó el uso de los ocho bits para los datos, lo que permitió disponer de espacio para otros 128 caracteres. En sus inicios, la mayoría de estos caracteres eran específicos del sistema, pero gradualmente surgieron los estándares ISO/IEC 8859 para proporcionar cierta similitud entre plataformas y facilitar el intercambio de información.

Hacia finales del siglo XX, con la disminución de los costos de almacenamiento y memoria, los problemas asociados con los múltiples significados de un código de ocho bits (solo en el conjunto de códigos ISO-Latin existen siete) dejaron de tener justificación. Todos los sistemas operativos principales adoptaron Unicode como su representación interna principal. Sin embargo, dado que Windows no admitía el método UTF-8 de codificación Unicode (prefiriendo UTF-16 ), muchas aplicaciones continuaron limitadas a estos conjuntos de caracteres antiguos.

El símbolo del euro

La introducción del euro y su símbolo asociado ( ) ejerció una presión significativa sobre los desarrolladores de sistemas informáticos para que dieran soporte a este nuevo símbolo, y la mayoría de los conjuntos de caracteres de 8 bits tuvieron que adaptarse de alguna manera.

  • Apple, con MacRoman, y Sun Microsystems , con Solaris OS, simplemente reemplazaron el símbolo genérico de moneda ( ¤ ). Esto causó dificultades en algunos lugares, ya que las organizaciones habían encontrado otros usos para ese símbolo , como el logotipo de la empresa.
  • La ISO introdujo una variante adicional de la ISO 8859, la ISO 8859-15 , que sustituyó el símbolo genérico de moneda por el símbolo del euro, además de realizar otras sustituciones de símbolos por letras con diacríticos. La ISO 8859-15 nunca tuvo una adopción generalizada.
  • Con Windows-1252 , Microsoft colocó el símbolo del euro en un hueco (posición 80 hexadecimal ) en los códigos de control C1 existentes , una decisión que otros proveedores consideraron contraria a la arquitectura.

Si bien estas decisiones tuvieron un efecto limitado en los documentos que solo se utilizaban en un único ordenador (o al menos dentro del " ecosistema digital " de un único proveedor ), significaron que los documentos que contenían el símbolo del euro no se mostrarían como se esperaba al intercambiarlos entre ecosistemas.

Todos estos problemas se han resuelto gracias a la actualización de los sistemas operativos para que admitan Unicode de forma estándar, que codifica el símbolo del euro en U+20AC (decimal 8364).

Tabla comparativa

Los puntos de código U+ 0000 a U+007F no se muestran en esta tabla, ya que están directamente asignados en todos los conjuntos de caracteres que se enumeran aquí. El estándar de codificación ASCII define la especificación original para la asignación de los primeros 0-127 caracteres.

La tabla está organizada por punto de código Unicode . Los conjuntos de caracteres se mencionan aquí por sus nombres IANA en mayúsculas .

  • Las asignaciones para las páginas de códigos de IBM provienen del sitio Unicode proporcionado por Microsoft . El documento del Consorcio Unicode contiene enlaces a fuentes que muestran las diferencias entre las asignaciones de IBM y Microsoft para estas páginas de códigos. [ 4 ]
  • Los procesadores IBM437 e IBM850 definieron caracteres imprimibles para los rangos de códigos de control. Si bien estos no podían utilizarse al imprimir texto a través de DOS , ya que se interceptaban antes de llegar a la pantalla, sí podían ser utilizados por aplicaciones que accedían directamente a la memoria de pantalla.
  • Macintosh tiene un logotipo de Apple en 0xF0 y lo traduce a U+F8FF en el Área de Uso Privado para Unicode.

Notas

  1. El PC DOS 2000 de IBM, lanzado en 1998, cambió su definición de la página de códigos 850 a lo que llamaron página de códigos 850 modificada, que ahora incluía el símbolo del euro en el punto de código 213 en lugar de agregar soporte para la nueva página de códigos 858. La razón de esto podría haber sido debido a las restricciones existentes en la implementación de la lógica de cambio de página de códigos bajo MS-DOS / PC DOS , que limitaba los archivos .CPI a 64KB de tamaño o aproximadamente seis páginas de códigos como máximo, una limitación, que fue eludida en algunas versiones OEM de MS-DOS, en Windows NT , y que tampoco existe en DR-DOS .Además, el analizador en MS-DOS/PCDOS limita el número de posibles entradas de país / página de códigos en los archivos COUNTRY.SYS a un máximo de 146 o 438, una limitación inexistente en DR-DOS.Por lo tanto, agregar soporte para la página de códigos 858 podría haber significado eliminar otra (por ejemplo, la página de códigos 850) al mismo tiempo, lo que podría no haber sido una solución viable en ese momento, dado que algunas aplicaciones estaban programadas para usar la página de códigos 850.  

Referencias

  1. "00858" . Páginas de códigos por CPGID . IBM . Archivado del original el 6 de junio de 2016. Consultado el 6 de junio de 2016 .
  2. Paul, Matthias R. (15 de agosto de 2001). "Cambio de páginas de códigos en FreeDOS" (Especificación de diseño técnico basada en la publicación de fd-dev)). Archivado del original el 06/06/2016 . Recuperado el 06/06/2016 . El nuevo ID oficial para la "página de códigos 850 multilingüe con SIGNO EURO" es 858, no 850. IBM cambiará a usar 858 en lugar de su variante 850 con futuras versiones de sus productos. [...] Solo puedo adivinar por qué no agregaron 858 a sus archivos EGAx.CPI , COUNTRY.SYS y KEYBOARD.SYS en PC DOS 2000. Muchas aplicaciones de terceros están diseñadas para funcionar con 850 y no sabían de 858 cuando se lanzó PC  DOS  2000, por lo que es más fácil para todos, pero desafortunadamente no es compatible.  [...] Como se explicó anteriormente, COUNTRY.SYS y KEYBOARD.SYS contienen solo dos entradas de página de códigos para un país determinado en las versiones occidentales de DOS. (En los problemas árabes y hebreos puede haber hasta 8 páginas de códigos para un país; en teoría, no hay límite por debajo del rango de páginas de códigos permitidas 1..65534).  [...] El problema es que eliminar la compatibilidad con 850 podría haber causado problemas de compatibilidad con aplicaciones que están configuradas para usar 850. Agregar 858 como tercera opción a todos los archivos habría aumentado significativamente el tamaño de los archivos y las tablas. El analizador de archivos COUNTRY.SYS en MS-DOS/PC  DOS IO.SYS / IBMBIO.COM reserva un área de trabajo de 6  Kb (para DOS  6) para cargar toda la información. Esto permite que se acepte un máximo de 438 entradas en un archivo COUNTRY.SYS; de lo contrario, recibirá el mensaje "COUNTRY.SYS es demasiado grande". El analizador NLSFUNC no tiene esta limitación, y los analizadores de archivos en DR-DOS (núcleo y NLSFUNC) tampoco conocen dicha restricción. Las versiones más antiguas de MS-DOS/PC  DOS incluso tenían un  búfer de 2 Kb para un máximo de 146 entradas.{{cite web}}: Enlace externo en |type=( ayuda )
  3. Paul, Matthias R. (27-08-2001). "Cambiar páginas de códigos en FreeDOS (seguimiento)" . Recuperado el 08-05-2013 . [...] también se podrían crear archivos .CPI personalizados en el estilo FONT tradicional sin dificultades, pero solo se podrían almacenar hasta [...] seis páginas de códigos en un archivo de este tipo si se quisiera que fuera utilizable por MS-DOS/PC DOS (algunos problemas de OEM y NT pueden manejar archivos de más de 64 Kb, pero MS-DOS/PC DOS no).   {{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  4. "Tablas de mapeo de conversión de IBM" . Consorcio Unicode.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Western_Latin_character_sets&oldid=1333586573 "