KOI8-RU es una codificación de caracteres de 8 bits , diseñada para cubrir el ruso , el ucraniano y el bielorruso , idiomas que utilizan el alfabeto cirílico . Está estrechamente relacionada con KOI8-R , que cubre el ruso y el búlgaro , pero reemplaza diez caracteres de dibujo de recuadros con cinco letras ucranianas y bielorrusas: Ґ , Є , І , Ї y Ў , tanto en mayúsculas como en minúsculas. Está aún más relacionada con KOI8-U , que no incluye Ў, pero realiza los mismos reemplazos de letras. Las asignaciones de letras adicionales se corresponden con KOI8-E , excepto Ґ, que se añade a KOI8-F .
En IBM , a KOI8-RU se le asigna la página de códigos/ CCSID 1167. [ 1 ] [ 2 ]
KOI8 sigue siendo mucho más común que ISO 8859-5 , que nunca llegó a popularizarse. Otra codificación común de caracteres cirílicos es Windows-1251 . En el futuro, ambas podrían ser reemplazadas por Unicode .
KOI8 significa K od o bmena i nformatsiey, 8 bits ( ruso : К од о бмена и нформацией, 8 бит ), que significa "Código para intercambio de información, 8 bits".
Los conjuntos de caracteres KOI8 tienen la particularidad de que las letras cirílicas rusas están en orden pseudorromano en lugar del orden alfabético cirílico natural como en ISO 8859-5. Aunque esto pueda parecer extraño, tiene la útil propiedad de que si se elimina el octavo bit, el texto aún puede leerse (o al menos descifrarse) en una transliteración con mayúsculas y minúsculas invertidas en una terminal ASCII común. Por ejemplo, "Код Обмена Информацией" en KOI8-RU se convierte en kOD oBMENA iNFORMACIEJ (el significado ruso del acrónimo "KOI") si se elimina el octavo bit.
Conjunto de caracteres
La siguiente tabla muestra la codificación KOI8-RU. Cada carácter se muestra con su punto de código Unicode equivalente .
Aunque RFC 2319 dice que el carácter 0x95 debería ser U+2219 (∙), también puede ser U+2022 (•) para que coincida con el carácter de viñeta en Windows-1251 .
Algunas referencias contienen un error tipográfico e indican erróneamente que el carácter 0xB4 es U+0403, en lugar del correcto U+0404. Este error tipográfico se encuentra en el Apéndice A del RFC 2319 (pero la tabla del texto principal del RFC proporciona la correspondencia correcta).
Véase también
Referencias
- ↑ "Documento informativo de la página 1167 del código" . Archivado del original el 16 de enero de 2017.
- ↑ "Documento informativo CCSID 1167" . Archivado del original el 27 de marzo de 2016.
- ↑ Leisher, Mark (1999-12-20), KOI8-RU Tabla de mapeo de caracteres cirílicos bielorrusos/ucranianos a Unicode 2.1 , KOI8RU.TXT, archivado del original el 28-07-2020 , recuperado el 29-04-2020
- ↑ Página de códigos CPGID 01167 (pdf) (PDF) , IBM
- ↑ Página de códigos CPGID 01167 (txt) , IBM
Enlaces externos
- Nechayev, Valentin (2013) [2001]. "Revisión del universo de codificaciones cirílicas de 8 bits" . Archivado del original el 5 de diciembre de 2016. Recuperado el 5 de diciembre de 2016 .
- Conjuntos de caracteres