
caten una ventana xterm.En informática , el texto plano es un término general para referirse a texto sin formato o datos no textuales representados como texto (por ejemplo, el contenido de un archivo) mediante caracteres imprimibles (como letras, dígitos, símbolos, espacios, tabulaciones y saltos de línea) en una codificación de caracteres . En principio, el texto plano puede estar en cualquier codificación, pero actualmente suele implicar UTF-8 .
El texto plano es diferente del texto formateado , donde se incluye información de estilo; del texto estructurado, donde se identifican partes estructurales del documento como párrafos, secciones, etc.; y de los archivos binarios en los que algunas partes deben interpretarse como objetos binarios (números enteros codificados, números reales, imágenes, etc.).
El texto plano se usa a menudo como contraparte de los archivos binarios: aquellos en los que al menos algunas partes del archivo no pueden interpretarse correctamente como texto. Por ejemplo, un archivo o cadena que consta de "hola", seguido de 4 bytes que expresan un entero binario que se supone que debe evaluarse en una representación de CPU como little endian , es un archivo binario.
Los archivos de texto que solo contienen texto codificado no tienen ningún indicador de codificación, ni número mágico , ni marcador especial al principio, ni metadatos que los identifiquen como texto en la mayoría de los sistemas de archivos . Sin embargo, los usuarios de Windows suelen añadir la extensión .txt a sus nombres de archivo, y otros sistemas operativos suelen asumir que los archivos no identificables son texto. No obstante, existe el tipo MIME " text/plain " que se utiliza para la transferencia a través de internet o entre componentes de software.
Texto plano y texto enriquecido
Según el estándar Unicode: [ 1 ]
- "El texto plano es una secuencia pura de códigos de caracteres; por lo tanto, el texto plano codificado en Unicode es una secuencia de códigos de caracteres Unicode."
- En cambio, el texto con formato , también conocido como texto enriquecido , es cualquier representación de texto que contiene texto plano más información añadida, como un identificador de idioma, tamaño de fuente, color, enlaces de hipertexto, etc.
- SGML , RTF , HTML , XML y TeX son ejemplos de texto enriquecido representado completamente como flujos de texto plano, intercalando datos de texto plano con secuencias de caracteres que representan las estructuras de datos adicionales.
Sin embargo, según otras definiciones, los archivos que contienen marcado u otros metadatos generalmente se consideran texto plano, siempre que el marcado también esté en un formato directamente legible para humanos (como en HTML, XML, etc.). Por lo tanto, representaciones como SGML, RTF, HTML, XML, marcado wiki y TeX, así como casi todos los archivos de código fuente de lenguajes de programación, se consideran texto plano. El contenido específico es irrelevante para determinar si un archivo es texto plano. Por ejemplo, un archivo SVG puede contener dibujos o incluso gráficos de mapa de bits, pero sigue siendo texto plano.
El uso de texto plano en lugar de archivos binarios permite que los archivos se conserven mucho mejor en entornos reales, en parte porque los hace prácticamente inmunes a las incompatibilidades de la arquitectura informática. Por ejemplo, al codificar todos los datos como texto UTF-8 , se evitan todos los problemas de orden de bytes .
Uso
El principal objetivo de usar texto plano hoy en día es la independencia de los programas que requieren su propia codificación, formato o formato de archivo especial . Los archivos de texto plano se pueden abrir, leer y editar con editores de texto y utilidades comunes.
Una interfaz de línea de comandos permite a los usuarios introducir comandos en texto plano y obtener una respuesta, también generalmente en texto plano.
Muchos otros programas informáticos también son capaces de procesar o crear texto plano, como innumerables programas en DOS , Windows , Mac OS clásico y Unix y sus derivados; así como navegadores web (algunos navegadores como Lynx y el Navegador en Modo Línea solo producen texto plano para su visualización) y otros lectores de texto electrónico .
Los archivos de texto plano son prácticamente universales en programación; un archivo de código fuente que contiene instrucciones en un lenguaje de programación es casi siempre un archivo de texto plano. El texto plano también se usa comúnmente para archivos de configuración , que se leen para guardar ajustes al iniciar un programa.
El texto plano se utiliza en muchos correos electrónicos .
Un comentario , un archivo " .txt " o un registro TXT generalmente contiene solo texto plano (sin formato) destinado a ser leído por humanos.
Codificación
Codificaciones de caracteres
Antes de principios de la década de 1960, las computadoras se usaban principalmente para cálculos numéricos en lugar de para texto, y la memoria era extremadamente cara. Las computadoras a menudo asignaban solo 6 bits a cada carácter, lo que permitía únicamente 64 caracteres; asignar códigos para AZ, az y los números del 0 al 9 dejaría solo 2 códigos, lo cual era totalmente insuficiente. La mayoría de las computadoras optaron por no admitir letras minúsculas. Por lo tanto, los primeros proyectos de texto, como el Index Thomisticus de Roberto Busa , el Corpus Brown y otros, tuvieron que recurrir a convenciones como colocar un asterisco antes de las letras que en realidad debían ser mayúsculas.
Fred Brooks de IBM defendió con vehemencia el uso de bytes de 8 bits, argumentando que algún día la gente podría necesitar procesar texto, y logró su objetivo. Si bien IBM utilizó EBCDIC , a partir de entonces la mayoría del texto se codificó en ASCII , utilizando valores del 0 al 31 para caracteres de control (no imprimibles) y valores del 32 al 127 para caracteres gráficos como letras, dígitos y signos de puntuación. La mayoría de las máquinas almacenaban los caracteres en 8 bits en lugar de 7, ignorando el bit restante o utilizándolo como suma de verificación .
Cuando se recibe un documento sin ninguna indicación explícita de la codificación de caracteres, algunas aplicaciones utilizan la detección de conjuntos de caracteres para intentar adivinar qué codificación se utilizó.
Véase también
Referencias
- ↑ "El estándar Unicode, versión 14.0" (PDF) . págs. 18–19 .
- formatos de archivos de texto
- Formatos abiertos