Articulo de referencia

Datos semiestructurados

Los datos semiestructurados [ 1 ] son ​​una forma de datos estructurados que no se ajustan a la estructura tabular de los modelos de datos asociados a las bases de datos relacio...

Los datos semiestructurados [ 1 ] son ​​una forma de datos estructurados que no se ajustan a la estructura tabular de los modelos de datos asociados a las bases de datos relacionales u otros tipos de tablas de datos , pero que, no obstante, contienen etiquetas u otros marcadores para separar elementos semánticos y establecer jerarquías de registros y campos dentro de los datos. Por lo tanto, también se les conoce como estructuras autodescriptivas .

En los datos semiestructurados, las entidades que pertenecen a la misma clase pueden tener atributos diferentes aunque estén agrupadas, y el orden de los atributos no es importante.

Los datos semiestructurados son cada vez más frecuentes desde la llegada de Internet, donde los documentos de texto completo y las bases de datos ya no son las únicas formas de datos, y las diferentes aplicaciones necesitan un medio para intercambiar información . En las bases de datos orientadas a objetos , es común encontrar datos semiestructurados.

Tipos

XML

XML , [ 2 ] otros lenguajes de marcado, correo electrónico y EDI son todas formas de datos semiestructurados. OEM (Object Exchange Model) [ 3 ] se creó antes que XML como un medio para autodescribir una estructura de datos. XML se ha popularizado gracias a los servicios web desarrollados utilizando los principios SOAP .

Algunos tipos de datos descritos aquí como "semiestructurados", especialmente XML, sufren la impresión de que son incapaces de tener el mismo rigor estructural al nivel funcional que las tablas y filas relacionales [ 4 ] . De hecho, la visión de XML como inherentemente semiestructurado (anteriormente, se le denominaba "no estructurado") ha limitado su uso para una gama cada vez mayor de aplicaciones centradas en datos [ 4 ] . Incluso los documentos, normalmente considerados como el epítome de la semiestructura, pueden diseñarse con prácticamente el mismo rigor que el esquema de base de datos , regido por el esquema XML [ 5 ] [ 6 ] y procesados ​​por programas de software tanto comerciales como personalizados [ 7 ] sin reducir su usabilidad para los lectores humanos.

En vista de esto, se podría decir que XML tiene una "estructura flexible", capaz de un flujo y una jerarquía centrados en el ser humano, así como una estructura de elementos y una tipificación de datos altamente rigurosas.

El concepto de XML como « legible para humanos », sin embargo, tiene sus limitaciones. Algunas implementaciones/dialectos de XML, como la representación XML del contenido de un documento de Microsoft Word , tal como se implementa en Office 2007 y versiones posteriores, utilizan docenas o incluso cientos de etiquetas diferentes que reflejan un dominio problemático específico (en el caso de Word, el formato a nivel de carácter, párrafo y documento, las definiciones de estilos, la inclusión de citas, etc.), las cuales se anidan entre sí de forma compleja. Comprender siquiera una parte de un documento XML de este tipo mediante su lectura, y mucho menos detectar errores en su estructura, es imposible sin un conocimiento previo muy profundo de la implementación específica de XML, junto con la ayuda de un software que comprenda el esquema XML empleado. Dicho texto no es «comprensible para humanos», del mismo modo que un libro escrito en suajili (que utiliza el alfabeto latino) no lo sería para un estadounidense o un europeo occidental que no conozca ni una palabra de ese idioma: las etiquetas son símbolos sin significado para una persona que desconoce el dominio.

JSON

JSON , o Notación de Objetos JavaScript, es un formato estándar abierto que utiliza texto legible para transmitir objetos de datos. JSON se ha popularizado gracias a los servicios web desarrollados con principios REST .

Las bases de datos como MongoDB y Couchbase almacenan los datos de forma nativa en formato JSON, aprovechando las ventajas de la arquitectura de datos semiestructurados.

Ventajas y desventajas

Ventajas

  • Los programadores que persisten objetos de su aplicación en una base de datos no necesitan preocuparse por la incompatibilidad de impedancia objeto-relacional , sino que a menudo pueden serializar objetos a través de una biblioteca ligera. [ 8 ]
  • La compatibilidad con datos anidados o jerárquicos suele simplificar los modelos de datos que representan relaciones complejas entre entidades.
  • La compatibilidad con listas de objetos simplifica los modelos de datos al evitar traducciones complicadas de listas a un modelo de datos relacional.

Desventajas

  • El modelo de datos relacional tradicional tiene un lenguaje de consulta popular y predefinido, SQL . [ 9 ]
  • Propenso al principio de "si introduces basura, obtendrás basura"; al eliminar las restricciones del modelo de datos, se requiere menos planificación previa para operar una aplicación de datos.

Modelo semiestructurado

El modelo semiestructurado es un modelo de base de datos en el que no existe separación entre los datos y el esquema , y ​​la cantidad de estructura utilizada depende del propósito.

Las ventajas de este modelo son las siguientes:

  • Puede representar la información de algunas fuentes de datos que no pueden estar restringidas por un esquema. [ 10 ] [ 1 ]
  • Proporciona un formato flexible para el intercambio de datos entre diferentes tipos de bases de datos. [ 10 ] [ 1 ]
  • Puede resultar útil ver los datos estructurados como semiestructurados (para fines de exploración). [ 1 ]
  • El esquema se puede modificar fácilmente.
  • El formato de transferencia de datos puede ser portátil.

La principal desventaja de usar un modelo de base de datos semiestructurada es que las consultas no se pueden realizar con la misma eficiencia que en una estructura más restringida, como el modelo relacional . Normalmente, los registros en una base de datos semiestructurada se almacenan con identificadores únicos que se referencian mediante punteros a su ubicación en el disco. Esto hace que las consultas de navegación o basadas en rutas sean bastante eficientes, pero para realizar búsquedas en muchos registros (como es habitual en SQL ), no es tan eficiente porque tiene que buscar en el disco siguiendo los punteros.

El Object Exchange Model (OEM) es un estándar para expresar datos semiestructurados; otra opción es XML .

Véase también

Referencias

  1. 1 2 3 4 Peter Buneman (1997). "Datos semiestructurados" (PDF) . Simposio sobre principios de sistemas de bases de datos .
  2. "El grupo de bases de datos de Penn tiene un proyecto de datos semiestructurados y XML" . Archivado del original el 2 de noviembre de 2013. Consultado el 25 de marzo de 2009 .
  3. Sistemas de gestión de bases de datos (DBMS) de la tradición de la Universidad de Stanford
  4. 1 2 Sperberg-McQueen, CM (octubre de 2005). "XML y datos semiestructurados" . Queue . Vol. 3, n.º 8. Association for Computing Machinery. págs. 34–41 . doi : 10.1145/1103822.1103834 . Recuperado el 5 de junio de 2026 .   
  5. Murata, Makoto; Lee, Dongwon; Mani, Murali; Kawaguchi, Kohsuke (noviembre de 2005). "Taxonomía de lenguajes de esquemas XML utilizando la teoría del lenguaje formal". ACM Transactions on Internet Technology . 5 (4): 660– 704. doi : 10.1145/1111627.1111631 .
  6. ^ Martens, Wim; Ni siquiera, Frank; Schwentick, Thomas; Bex, Geert Jan (septiembre de 2006). "Expresividad y complejidad del esquema XML". Transacciones ACM en sistemas de bases de datos . 31 (3): 770– 813. doi : 10.1145/1166074.1166076 . hdl : 1942/1424 .
  7. Bourret, Ronald (septiembre de 2005). "XML y bases de datos" .
  8. Fowler, Martin (2002). Patrones de arquitectura de aplicaciones empresariales . Addison-Wesley. pág. 161. 
  9. Silberschatz, Abraham; Korth, Henry F.; Sudarshan, S. (2011). Conceptos de sistemas de bases de datos (6.ª ed.). McGraw-Hill. pág. 29.  
  10. 1 2 Abiteboul, Serge (1997). "Consulta de datos semiestructurados" . En Afrati, Foto; Kolaitis, Phokion (eds.). Teoría de bases de datos — ICDT '97 . Lecture Notes in Computer Science. Vol. 1186. Berlín, Heidelberg: Springer. pp. 1–18 . doi : 10.1007/3-540-62222-5_33 . hdl : 2060/20050061322 . ISBN   978-3-540-49682-3.
  • Grupo de bases de datos de UPenn Archivado el 2 de noviembre de 2013 en Wayback Machine : datos semiestructurados y XML 
  • Análisis de datos semiestructurados: ¿Plataforma relacional o Hadoop? por IBM
  • Datos semiestructurados explicados por CROWDSTRIKE
Obtenido de " https://en.wikipedia.org/w/index.php?title=Semi-structured_data&oldid=1360557730#Semi-structured_model "