Articulo de referencia

Soporte legible por máquina y datos

ISBN , un identificador numérico único para libros, representado como un código de barras EAN-13 . Muestra tanto barras legibles por máquina como dígitos legibles por humanos. E...

ISBN , un identificador numérico único para libros, representado como un código de barras EAN-13 . Muestra tanto barras legibles por máquina como dígitos legibles por humanos.

En comunicaciones e informática , un soporte legible por máquina (o soporte legible por ordenador ) es un soporte capaz de almacenar datos en un formato fácilmente legible por un ordenador digital o un sensor . Se diferencia de los soportes y datos legibles por humanos .

El resultado se denomina datos legibles por máquina o datos legibles por ordenador , y los datos en sí mismos pueden describirse como legibles por máquina .

Datos

Los datos legibles por máquina deben ser datos estructurados . [ 1 ]

Los intentos por crear datos legibles por máquina se remontan a la década de 1960. Al mismo tiempo que se publicaban avances fundamentales en lectura automática y procesamiento del lenguaje natural (como ELIZA de Weizenbaum ), se anticipaba el éxito de la funcionalidad de lectura automática y se intentaba crear documentos legibles por máquina. Un ejemplo de ello fue la creación, en 1966, por la musicóloga Nancy B. Reich, de un catálogo legible por máquina de las obras del compositor William Jay Sydeman .

En Estados Unidos, la Ley de Datos Abiertos del Gobierno del 14 de enero de 2019 define los datos legibles por máquina como "datos en un formato que puede ser procesado fácilmente por una computadora sin intervención humana, garantizando que no se pierda el significado semántico". La ley ordena a las agencias federales de EE. UU. que publiquen los datos públicos de esta manera, [ 2 ] asegurando que "cualquier activo de datos públicos de la agencia sea legible por máquina". [ 3 ]

Los datos legibles por máquina se pueden clasificar en dos grupos: datos legibles por humanos que están marcados para que también puedan ser leídos por máquinas (por ejemplo, microformatos , RDFa , HTML ) y formatos de archivo de datos destinados principalmente al procesamiento por máquinas ( CSV , RDF , XML , JSON ). Estos formatos solo son legibles por máquina si los datos que contienen están estructurados formalmente; exportar un archivo CSV desde una hoja de cálculo mal estructurada no cumple con la definición.

Que un documento sea legible por máquina no es sinónimo de que sea accesible digitalmente . Un documento accesible digitalmente puede estar en línea, lo que facilita el acceso a los humanos a través de computadoras, pero su contenido es mucho más difícil de extraer, transformar y procesar mediante lógica de programación informática si no es legible por máquina. [ 4 ]

El lenguaje de marcado extensible (XML) está diseñado para ser legible tanto por humanos como por máquinas, y las transformaciones del lenguaje de hojas de estilo extensibles (XSLT) se utilizan para mejorar la presentación de los datos y facilitar su lectura. Por ejemplo, XSLT puede utilizarse para convertir automáticamente XML a formato PDF. Los datos legibles por máquinas pueden transformarse automáticamente para que sean legibles por humanos, pero, por lo general, no ocurre lo contrario.

Para los fines de la implementación de la Ley de Modernización de la Ley de Desempeño y Resultados del Gobierno (GPRA, por sus siglas en inglés), la Oficina de Administración y Presupuesto (OMB, por sus siglas en inglés) define el "formato legible por máquina" de la siguiente manera: "Formato en un lenguaje informático estándar (no texto en inglés) que puede ser leído automáticamente por un navegador web o un sistema informático (por ejemplo, XML). Los documentos tradicionales de procesamiento de texto y los archivos PDF (formato de documento portátil) son fáciles de leer para los humanos, pero generalmente son difíciles de interpretar para las máquinas. Otros formatos, como el lenguaje de marcado extensible ( XML ), JSON o las hojas de cálculo con columnas de encabezado que se pueden exportar como valores separados por comas (CSV), son formatos legibles por máquina. Dado que HTML es un lenguaje de marcado estructural que etiqueta discretamente partes del documento, las computadoras pueden recopilar componentes del documento para ensamblar tablas de contenido, esquemas, bibliografías de búsqueda bibliográfica, etc. Es posible hacer que los documentos tradicionales de procesamiento de texto y otros formatos sean legibles por máquina, pero los documentos deben incluir elementos estructurales mejorados". [ 5 ]

Medios de comunicación

Entre los ejemplos de soportes legibles por máquina se incluyen soportes magnéticos como discos magnéticos , tarjetas, cintas y tambores , tarjetas perforadas y cintas de papel , discos ópticos , códigos de barras y caracteres de tinta magnética .

Entre las tecnologías comunes de lectura automática se incluyen la grabación magnética, el procesamiento de formas de onda y los códigos de barras . El reconocimiento óptico de caracteres (OCR) permite que las máquinas lean información accesible a los humanos. Cualquier información recuperable mediante cualquier forma de energía puede ser legible por máquina.

Algunos ejemplos son:

Aplicaciones

Documentos

Un documento legible por máquina es aquel cuyo contenido puede ser procesado fácilmente por ordenadores . Estos documentos se distinguen de los datos legibles por máquina más generales por tener una estructura adicional que proporciona el contexto necesario para respaldar los procesos de negocio para los que se crean.

Catálogos

MARC (catálisis legible por máquina) es un conjunto estándar de formatos digitales para la descripción legible por máquina de los elementos catalogados por las bibliotecas, como libros, DVD y recursos digitales. Los catálogos de bibliotecas informatizados y el software de gestión de bibliotecas deben estructurar sus registros de catálogo según un estándar del sector, que es MARC, para que la información bibliográfica pueda compartirse libremente entre ordenadores. La estructura de los registros bibliográficos sigue casi universalmente el estándar MARC. Otros estándares funcionan conjuntamente con MARC; por ejemplo, las Reglas de Catalogación Angloamericanas (AACR)/ Descripción y Acceso de Recursos (RDA) proporcionan directrices para formular datos bibliográficos en la estructura de registro MARC, mientras que la Descripción Bibliográfica Estándar Internacional (ISBD) proporciona directrices para mostrar los registros MARC en un formato estándar legible por humanos.

Diccionarios

Un diccionario legible por máquina (MRD, por sus siglas en inglés) es un diccionario almacenado como datos legibles por máquina en lugar de estar impreso en papel. Es un diccionario electrónico y una base de datos léxica .

Un diccionario legible por máquina es un diccionario electrónico que se puede cargar en una base de datos y consultar mediante software de aplicación. Puede ser un diccionario explicativo monolingüe o un diccionario multilingüe para facilitar la traducción entre dos o más idiomas, o una combinación de ambos. El software de traducción entre varios idiomas suele utilizar diccionarios bidireccionales. Un diccionario legible por máquina puede tener una estructura propietaria que se consulta mediante software específico (por ejemplo, en línea a través de internet) o puede tener una estructura abierta y estar disponible para su carga en bases de datos informáticas, pudiendo así utilizarse mediante diversas aplicaciones de software. Los diccionarios convencionales contienen un lema con varias descripciones. Un diccionario legible por máquina puede tener capacidades adicionales y, por lo tanto, a veces se le denomina diccionario inteligente. Un ejemplo de diccionario inteligente es el diccionario de código abierto Gellish English Dictionary .

El término diccionario también se utiliza para referirse a un vocabulario o léxico electrónico , como los que se usan, por ejemplo, en los correctores ortográficos . Si los diccionarios están organizados en una jerarquía de subtipos y supertipos de conceptos (o términos), se denomina taxonomía . Si además contiene otras relaciones entre los conceptos, se denomina ontología . Los motores de búsqueda pueden utilizar un vocabulario, una taxonomía o una ontología para optimizar los resultados de búsqueda. Los diccionarios electrónicos especializados son los diccionarios morfológicos o los diccionarios sintácticos.

El término MRD se suele contrastar con diccionario de PLN , ya que un MRD es la versión electrónica de un diccionario impreso previamente en papel. Si bien ambos términos son utilizados por programas, se prefiere el término diccionario de PLN cuando el diccionario se ha creado desde cero teniendo en cuenta el PLN. Existe un estándar ISO para MRD y PLN que permite representar ambas estructuras y se denomina Marco de Marcado Léxico . [ 6 ]

Pasaportes

Un pasaporte de lectura mecánica (PRM) es un documento de viaje de lectura mecánica (DTM) con los datos de la página de identidad codificados en formato de reconocimiento óptico de caracteres . Muchos países comenzaron a emitir documentos de viaje de lectura mecánica en la década de 1980. La mayoría de los pasaportes de viaje en todo el mundo son PRM. La Organización de Aviación Civil Internacional (OACI) exigió a todos sus Estados miembros que emitieran únicamente PRM a partir del 1 de abril de 2010, y todos los pasaportes que no fueran PRM caducarían el 24 de noviembre de 2015. [ 7 ]

Los pasaportes de lectura mecánica están estandarizados por el documento 9303 de la OACI (avalado por la Organización Internacional de Normalización y la Comisión Electrotécnica Internacional como ISO/IEC 7501-1) y cuentan con una zona especial de lectura mecánica ( ZRM ), que suele estar ubicada en la parte inferior de la página de identidad, al comienzo del pasaporte. El documento 9303 de la OACI describe tres tipos de documentos que corresponden a los tamaños de la norma ISO/IEC 7810 :

  • El formato "Tipo 3" es típico de los libretos de pasaporte. El MRZ consta de 2 líneas × 44 caracteres.
  • El "Tipo 2" es relativamente raro y consta de 2 líneas × 36 caracteres.
  • El formato "Tipo 1" tiene el tamaño de una tarjeta de crédito y consta de 3 líneas × 30 caracteres.

El formato fijo permite especificar el tipo de documento, el nombre, el número de documento, la nacionalidad, la fecha de nacimiento, el sexo y la fecha de caducidad. Todos estos campos son obligatorios en un pasaporte. Hay espacio para información complementaria opcional, que suele depender del país. También existen dos tamaños de visados ​​legibles por máquina con un formato similar.

Los ordenadores equipados con cámara y el software adecuado pueden leer directamente la información de los pasaportes de lectura mecánica. Esto permite una tramitación más rápida de los pasajeros por parte de los funcionarios de inmigración, una mayor precisión que la lectura manual de pasaportes, así como una introducción de datos más ágil, un mayor volumen de datos a leer y una mejor comparación con las bases de datos y listas de vigilancia de inmigración.

Además de la información legible ópticamente, muchos pasaportes contienen un chip RFID que permite a las computadoras leer una mayor cantidad de información, como por ejemplo una fotografía del titular. Estos pasaportes se denominan pasaportes biométricos y también están descritos en la norma ICAO 9303.

Véase también

Referencias

  1. http://-07-22 .{{cite web}}: Comprobar |url=valor ( ayuda ) ; Falta o está vacío |title=( ayuda )
  2. "HR4174" . stratml.us .
  3. "HR4174" . stratml.us .
  4. Hendler, Jim; Pardo, Theresa A. (24 de septiembre de 2012). "Introducción a la legibilidad por máquina de documentos y datos en línea" . Data.gov . Archivado del original el 20 de marzo de 2021. Consultado el 27 de febrero de 2015 .
  5. Circular A-11 de la OMB, Parte 6 , Preparación, presentación y ejecución del presupuesto
  6. Gil Francopoulo (editor) LMF Lexical Markup Framework, ISTE / Wiley 2013 ( ISBN) 978-1-84821-430-9)
  7. "Última semana para que los Estados garanticen la caducidad de los pasaportes no legibles por máquina" . OACI . Montreal. 17 de noviembre de 2015. Consultado el 11 de marzo de 2024 .

Dominio público Este artículo incorpora material de dominio público de la Norma Federal 1037C . Administración de Servicios Generales . Archivado del original el 22 de enero de 2022.