Windows-1251 es una codificación de caracteres de 8 bits , diseñada para abarcar idiomas que utilizan el alfabeto cirílico , como el ruso , el ucraniano , el bielorruso , el búlgaro , el serbio cirílico , el macedonio y otros idiomas.
En la web, es la segunda codificación de caracteres de un solo byte más utilizada (o la tercera más utilizada en general), y la más utilizada de las codificaciones de un solo byte que admiten el alfabeto cirílico. A partir de enero de 2024 , el 0,3% de todos los sitios web usan Windows-1251. [ 1 ] [ 2 ] Se usa principalmente para el ruso, mientras que una pequeña minoría de sitios web rusos lo usa, con el 94,6% de los sitios web rusos (.ru) usando UTF-8 , [ 3 ] [ 4 ] [ 5 ] y la codificación heredada de 8 bits es un segundo lugar distante. En Linux, la codificación se conoce como cp1251. [ 6 ] IBM usa la página de códigos 1251 ( CCSID 1251 y CCSID extendido del signo del euro 5347) para Windows-1251. [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ]
Windows-1251 y KOI8-R (o su variante ucraniana KOI8-U ) se utilizan mucho más comúnmente que ISO 8859-5 (que es utilizado por menos del 0,0004% de los sitios web). [ 14 ] A diferencia de Windows-1252 e ISO 8859-1 , Windows-1251 no está estrechamente relacionado con ISO 8859-5.
Unicode (por ejemplo, UTF-8) se prefiere a Windows-1251 u otras codificaciones cirílicas en las aplicaciones modernas, especialmente en Internet, lo que convierte a UTF-8 en la codificación dominante para las páginas web. (Para obtener más información sobre la cobertura completa de Unicode, que incluye 436 letras/puntos de código cirílicos, incluido el cirílico antiguo , y cómo las codificaciones de caracteres de un solo byte, como Windows-1251 y KOI8-R , no pueden ofrecer esta funcionalidad, consulte Escritura cirílica en Unicode ).
Conjunto de caracteres
La siguiente tabla muestra Windows-1251. Cada carácter se muestra con su equivalente Unicode y su código Alt .
variantes kazajas
KZ-1048
Una versión modificada de Windows-1251 fue estandarizada en Kazajstán como el estándar kazajo STRK1048, y se conoce con la etiqueta KZ-1048. Se diferencia en las filas que se muestran a continuación:
Página de código 1174
La página de códigos 1174 es otra variante creada para el idioma kazajo , que coincide con Windows-1251 para el subconjunto ruso de las letras cirílicas. Se diferencia de KZ-1048 en que la letra cirílica Shha pasa de 8E/9E a 8A/9A.
variante letona
Windows Latvian + Russian es una modificación de Windows-1251 para admitir el idioma letón . Utiliza la letra Ō/ō, abolida en 1946 pero aún en uso en el idioma latgaliano, mientras que carece de la letra Ŗ/ŗ.
variante finlandesa
Windows Cyrillic + Finnish es una modificación de Windows-1251 que Paratype utilizó para cubrir el idioma finlandés . Esta codificación es compatible con FontLab Studio 5. [ 18 ] A esta variante le faltan las letras Š y Ž que se utilizan en préstamos en finlandés y pueden reemplazarse por los dígrafos SH y ZH.
Variante Amiga
Los sistemas Amiga OS rusos utilizaban una versión de la página de códigos 1251 que coincide con Windows-1251 para el subconjunto ruso de las letras cirílicas, pero por lo demás sigue mayormente ISO-8859-1 . Esta versión se conoce como Amiga-1251 , [ 19 ] nombre con el que está registrada en la IANA . [ 20 ]
- ↑ Coincide con ISO-8859-15 ; en una ubicación diferente a la de Windows-1251
- ↑ Presente en Windows-1251, pero en una ubicación diferente (ausente en ISO-8859-1/15)
Véase también
Referencias
- ↑ "Tendencias históricas en el uso de codificaciones de caracteres, enero de 2024" . Consultado el 1 de enero de 2024 .
- ↑ "Preguntas frecuentes" .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que usan .ru" . w3techs.com . Consultado el 1 de enero de 2024 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan ruso" . w3techs.com . Consultado el 16 de enero de 2023 .
- ↑ "Distribución de codificaciones de caracteres entre sitios web que utilizan la Federación Rusa" . w3techs.com . Consultado el 5 de noviembre de 2021 .
- ↑ "cp1251(7) - Página del manual de Linux" . man7.org . Consultado el 1 de julio de 2018 .
- ↑ "Documento informativo de la página 1251 del código" . Archivado del original el 3 de marzo de 2016.
- ↑ "Documento informativo CCSID 1251" . Archivado del original el 29/11/2014.
- ↑ "Documento informativo CCSID 5347" . Archivado del original el 29/11/2014.
- ↑ Página de códigos CPGID 01251 (pdf) (PDF) , IBM
- ↑ Página de códigos CPGID 01251 (txt) , IBM
- ↑ Componentes internacionales para Unicode (ICU), ibm-1251_P100-1995.ucm , 3 de diciembre de 2002
- ↑ Componentes internacionales para Unicode (ICU), ibm-5347_P100-1998.ucm , 3 de diciembre de 2002
- ↑ "Estadísticas de uso de codificaciones de caracteres para sitios web" . w3techs.com .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Steele, Shawn (1998). Tabla de conversión de CP1251 a Unicode . Consorcio Unicode . CP1251.TXT.
- ↑ Whistler, Ken (2007). KZ-1048 a Unicode . Consorcio Unicode . KZ1048.TXT.
- ↑ ibm-1174_X100-2007.ucm , IBM
- ↑ "FontLab Studio 5. Editor de fuentes clásico profesional para Mac y Windows" .
- 1 2 Malyshev, Michael (2003). "Amiga-1251 a la tabla Unicode". Registro del nuevo conjunto de caracteres [ Amiga-1251 ] . IANA.
- ↑ "Conjuntos de caracteres" . IANA.
Lecturas adicionales
- Kornai, Andras; Birnbaum, David J.; da Cruz, Frank; Davis, Bur; cazador, George; Paine, Richard B.; Paperno, Slava; Simonsen, Keld J.; Thobe, Glenn E.; Vulis, Dimitri; van Wingen, Johan W. (13 de marzo de 1993). "Preguntas frecuentes sobre CODIFICACIÓN CIRÍLICA Versión 1.3" . Consultado el 24 de junio de 2020 .
Enlaces externos
- Tabla de referencia de Windows 1251
- Registro de nombres de conjuntos de caracteres de IANA
- Asignaciones Unicode de ventanas 1251 con "mejor ajuste"
- Decodificador universal de caracteres cirílicos , un programa en línea que puede ayudar a recuperar textos cirílicos ilegibles con codificaciones de caracteres Windows-1251 u otras codificaciones dañadas .
- Páginas de código de Windows