Articulo de referencia

Machine-readable document

A machine-readable document is a document whose content can be readily processed by computers . Such documents are distinguished from more general machine-readable data by virtu...

A machine-readable document is a document whose content can be readily processed by computers. Such documents are distinguished from more general machine-readable data by virtue of having further structure to provide the necessary context to support the business processes for which they are created.

Definition

Data without context is meaningless and lacks the four essential characteristics of trustworthy business records specified in ISO 15489 Information and documentation – Records management:[1]

The vast bulk of information is unstructured data and, from a business perspective, that means it is "immature", i.e., Level 1 (chaotic) of the Capability Maturity Model. Such immaturity fosters inefficiency, diminishes quality, and limits effectiveness. Unstructured information is also ill-suited for records management functions, provides inadequate evidence for legal purposes, drives up the cost of discovery in litigation, and makes access and usage needlessly cumbersome in routine, ongoing business processes.

There are at least four aspects to machine-readability:

  • First, words or phrases should be discretely delineated (tagged) so that computer software and/or hardware logic can be applied to them as individual conceptual elements.
  • Second, the semantics of each element should be specified so that computers can help human beings achieve a common understanding of their meanings and potential usages.
  • Third, if the relationships among the individual elements are also specified, computers can automatically apply inferences to them, thereby further relieving human beings of the burden of trying to understand them, particularly for purposes of inquiry, discovery, and analysis.
  • Fourth, if the structures of the documents in which the elements occur are also specified, human understanding is further enhanced and the data becomes more reliable for legal and business-quality purposes.

Ya en 1983, la Oficina de Responsabilidad Gubernamental de los Estados Unidos (GAO) comenzó a enfatizar los beneficios de la información legible por máquina. [ 2 ] Aún antes, en 1981, la GAO comenzó a informar sobre el problema de las prácticas inadecuadas de mantenimiento de registros en el gobierno federal de los Estados Unidos . [ 3 ] Tales deficiencias no son exclusivas del gobierno y los avances en la tecnología de la información significan que la mayor parte de la información ahora "nace digital" y, por lo tanto, potencialmente mucho más fácil de administrar por medios automatizados. [ 4 ] Sin embargo, en testimonio ante el Congreso en 2010, la GAO destacó problemas con la administración de registros electrónicos, y tan recientemente como en 2015, la GAO ha continuado informando deficiencias en el desempeño de las agencias del Poder Ejecutivo en el cumplimiento de los requisitos de administración de registros. [ 5 ] [ 6 ] Además, más de dos décadas después de que una importante y anteriormente muy respetada firma de auditoría, Arthur Andersen , llegara a su fin debido a un escándalo de destrucción de registros, las prácticas de mantenimiento de registros se convirtieron en un tema central en las elecciones presidenciales de 2016.

El 4 de enero de 2011, el presidente Obama promulgó la HR 2142, la Ley de Modernización de la Ley de Desempeño y Resultados del Gobierno (GPRA) de 2010 (GPRAMA), como la PL 111-352. La Sección 10 de la GPRAMA exige que las agencias federales de EE. UU. publiquen sus planes e informes estratégicos y de desempeño en un formato legible por máquina y con capacidad de búsqueda. [ 7 ] Además, en 2013, emitió la Orden Ejecutiva 13642, que convierte la información gubernamental en formato abierto y legible por máquina como el nuevo estándar. [ 8 ] El 28 de julio de 2016, la Oficina de Administración y Presupuesto (OMB) dio seguimiento al incluir en la emisión revisada de la Circular A-130 la instrucción para que las agencias utilicen formatos abiertos y legibles por máquina, [ 9 ] y publiquen "información pública en línea de una manera que promueva el análisis y la reutilización para la gama más amplia posible de propósitos", [ 10 ] lo que significa que la información es accesible al público y legible por máquina. El 14 de enero de 2019, el presidente Trump promulgó la ley HR 4174, [ 11 ] la Ley de Datos Abiertos del Gobierno (OGDA), que codifica en la ley el requisito de que las agencias pongan a disposición sus activos de datos públicos en un formato legible por máquina. El 28 de junio de 2019, en la Circular A-11, [ 12 ] la OMB expresó su intención de comenzar a cumplir con la sección 10 de GPRAMA. [ 13 ]

En apoyo de esta política, el avance tecnológico permite una gestión y un uso más eficientes y efectivos de los registros electrónicos legibles por máquina. Se han desarrollado bases de datos orientadas a documentos para almacenar, recuperar y gestionar información documental, también conocida como datos semiestructurados. El Lenguaje de Marcado Extensible ( XML ) es una recomendación del Consorcio World Wide Web ( W3C ) que establece reglas para codificar documentos en un formato legible tanto por humanos como por máquinas. Se han desarrollado numerosas herramientas de edición XML y la mayoría, si no todas, las principales aplicaciones de tecnología de la información son compatibles con XML en mayor o menor medida. El hecho de que XML sea un formato abierto, estándar y legible por máquina facilita considerablemente su uso para los desarrolladores de aplicaciones.

La recomendación del W3C sobre el esquema XML ( XSD ) especifica cómo describir formalmente los elementos de un documento XML. En lo que respecta a la especificación de esquemas XML, la Organización para el Avance de los Estándares de Información Estructurada (OASIS) es una organización líder en el desarrollo de estándares . Sin embargo, muchos desarrolladores técnicos prefieren trabajar con JSON , y para definir la estructura de los datos JSON para la validación, la documentación y el control de la interacción, el Grupo de Trabajo de Ingeniería de Internet (IETF) desarrolló JSON Schema .

El formato de documento portátil (PDF) es un formato de archivo utilizado para presentar documentos de forma independiente del software, el hardware y los sistemas operativos. Cada archivo PDF encapsula una descripción completa de la presentación del documento, incluyendo el texto, las fuentes, los gráficos y demás información necesaria para su visualización. PDF/A es una versión estandarizada por la ISO del PDF, especializada para el archivo y la conservación a largo plazo de documentos electrónicos. PDF/A-3 permite la incrustación de otros formatos de archivo, incluyendo XML , en documentos compatibles con PDF/A , lo que potencialmente proporciona lo mejor en cuanto a legibilidad tanto para humanos como para máquinas. El lenguaje de marcado XSL-FO (XSL Formatting Objects) del W3C se utiliza comúnmente para generar archivos PDF.

Los metadatos , información sobre datos, pueden utilizarse para organizar recursos electrónicos, proporcionar identificación digital y respaldar el archivo y la preservación de recursos. En registros electrónicos bien estructurados y legibles por máquina, el contenido puede reutilizarse como datos y metadatos. En el contexto de los sistemas de gestión de registros electrónicos, los términos "gestión" y "metadatos" son prácticamente sinónimos. Con los metadatos adecuados, las funciones de gestión de registros pueden automatizarse, reduciendo así el riesgo de destrucción de pruebas y otras manipulaciones fraudulentas de los registros. Además, dichos registros pueden utilizarse para automatizar el proceso de auditoría de los datos almacenados en bases de datos , reduciendo así el riesgo de puntos únicos de fallo asociados al concepto maquiavélico de una única fuente de verdad .

Las cadenas de bloques permiten crear y mantener listas de registros en constante crecimiento, protegidas contra manipulaciones y modificaciones. Una característica clave es que cada nodo en un sistema descentralizado tiene una copia de la cadena de bloques, por lo que no existe un único punto de fallo susceptible de manipulación y fraude .

Véase también

Referencias

  1. "Guía de NARA sobre la gestión de registros web" . Archivos Nacionales . 15 de agosto de 2016.
  2. "Un mejor uso de la tecnología de la información puede reducir la carga del papeleo federal" (PDF) . gao.gov . 11 de abril de 1983. Consultado el 25 de julio de 2019 .
  3. "GESTIÓN DE REGISTROS FEDERALES: Una historia de negligencia" . gao.gov . 24 de febrero de 1981. Consultado el 8 de septiembre de 2016 .
  4. "Definiendo "Nacido Digital": Un ensayo de Ricky Erway, OCLC Research" (PDF) . oclc.org . 30 de noviembre de 2010. Consultado el 8 de septiembre de 2016 .
  5. "GESTIÓN DE LA INFORMACIÓN: Los desafíos de la gestión de registros electrónicos, Declaración de Valerie C. Melvin, Directora de Gestión de la Información y Asuntos de Capital Humano" (PDF) . gao.gov . 17 de junio de 2010. Consultado el 8 de septiembre de 2016 .
  6. "GESTIÓN DE LA INFORMACIÓN: Se necesitan medidas adicionales para cumplir con los requisitos de la Directiva sobre la gestión de los registros gubernamentales" . gao.gov . 14 de mayo de 2015. Consultado el 8 de septiembre de 2016 .
  7. "GPRAMA SEC. 10. FORMATO DE PLANES E INFORMES DE DESEMPEÑO" . congress.gov . 4 de enero de 2011. Archivado del original el 13 de abril de 2016. Consultado el 8 de septiembre de 2016 .
  8. "Orden Ejecutiva 13642 en formato abierto, estándar y legible por máquina de lenguaje de marcado estratégico" . Casa Blanca . 9 de mayo de 2013. Archivado del original el 3 de marzo de 2016. Consultado el 8 de septiembre de 2016 .
  9. "Circular del Plan Estratégico N.º A-130, Gestión de la información como recurso estratégico, Objetivo d.5.a: Interoperabilidad, API y legibilidad por máquina" .
  10. "Circular del Plan Estratégico N° A-130, Gestión de la información como recurso estratégico, Objetivo e.2.a: Publicación" .
  11. Ryan, Paul D. (14 de enero de 2019). "Texto - HR4174 - 115.º Congreso (2017-2018): Ley de Fundamentos para la Elaboración de Políticas Basadas en Evidencia de 2018" . www.congress.gov .
  12. "PREPARACIÓN, PRESENTACIÓN Y EJECUCIÓN DEL PRESUPUESTO" (PDF) . Casa Blanca . 28 de junio de 2019. Consultado el 25 de julio de 2019 .
  13. "Circular del Plan Estratégico N.º A-130, Gestión de la información como recurso estratégico, Objetivo: legibilidad por máquina" .
  • OMB M-13-13 , Política de datos abiertos: Gestión de la información como un activo, que exige a las agencias el uso de estándares de formato de datos abiertos y legibles por máquina.
  • Guía de NARA sobre la gestión de registros web , enero de 2005, que describe las características de los registros fiables.
  • Un golpe mortal al método de gestión documental de Capone Consultancy: Mejores prácticas para corregir tonterías que no son ni documentales ni políticas , 9 de marzo de 2015
  • El Código de los Estados Unidos, que incluye el término "legible por máquina" más de 50 veces hasta el 10 de septiembre de 2016.