La integración de datos es el proceso de combinar, compartir o sincronizar datos de múltiples fuentes para proporcionar a los usuarios una vista unificada. [ 1 ] Existe una amplia gama de posibles aplicaciones para la integración de datos, desde comerciales (como cuando una empresa fusiona múltiples bases de datos ) hasta científicas (combinando datos de investigación de diferentes repositorios bioinformáticos ).
La decisión de integrar datos suele surgir cuando el volumen, la complejidad (es decir, el big data ) y la necesidad de compartir los datos existentes se disparan . [ 2 ] Se ha convertido en el foco de un extenso trabajo teórico, y numerosos problemas abiertos siguen sin resolverse.
La integración de datos fomenta la colaboración entre usuarios internos y externos. Los datos que se integran deben recibirse de un sistema de base de datos heterogéneo y transformarse en un único almacén de datos coherente que proporcione datos sincronizados a través de una red de archivos para los clientes. [ 3 ] Un uso común de la integración de datos es la minería de datos , al analizar y extraer información de bases de datos existentes que puede ser útil para la información empresarial . [ 4 ]
Historia


Desde hace tiempo existen problemas al combinar fuentes de datos heterogéneas , a menudo denominadas silos de información , bajo una única interfaz de consulta. A principios de la década de 1980, los informáticos comenzaron a diseñar sistemas para la interoperabilidad de bases de datos heterogéneas. [ 5 ]
El primer sistema de integración de datos impulsado por metadatos estructurados se diseñó en 1991 en la Universidad de Minnesota para la Serie Integrada de Microdatos de Uso Público (IPUMS) . IPUMS empleó un enfoque de almacenamiento de datos , que extrae, transforma y carga datos de fuentes heterogéneas en un esquema de vista único para que los datos de diferentes fuentes sean compatibles. [ 6 ] Al lograr la interoperabilidad de miles de bases de datos poblacionales, IPUMS demostró la viabilidad de la integración de datos a gran escala. El enfoque de almacenamiento de datos ofrece una arquitectura estrechamente acoplada porque los datos ya están físicamente conciliados en un único repositorio consultable, por lo que generalmente se requiere poco tiempo para resolver las consultas. [ 7 ]
El enfoque de almacén de datos es menos viable para conjuntos de datos que se actualizan con frecuencia, ya que requiere la ejecución continua del proceso de extracción, transformación y carga (ETL) para su sincronización. También surgen dificultades al construir almacenes de datos cuando solo se dispone de una interfaz de consulta a fuentes de datos resumidas y no se tiene acceso a los datos completos. Este problema suele presentarse al integrar varios servicios de consulta comerciales, como aplicaciones web de viajes o anuncios clasificados.
En 2009, se inició una tendencia que favorecía el acoplamiento flexible de datos [ 8 ] y proporcionaba una interfaz de consulta unificada para acceder a datos en tiempo real a través de un esquema mediado (véase la Figura 2), lo que permitía recuperar información directamente de las bases de datos originales. Esto es coherente con el enfoque SOA popular en aquella época. Este enfoque se basa en mapeos entre el esquema mediado y el esquema de las fuentes originales, y en la traducción de una consulta a consultas descompuestas para que coincidan con el esquema de las bases de datos originales. Dichos mapeos pueden especificarse de dos maneras: como un mapeo de entidades en el esquema mediado a entidades en las fuentes originales (el enfoque "Global como Vista" [ 9 ] (GAV)), o como un mapeo de entidades en las fuentes originales al esquema mediado (el enfoque "Local como Vista" [ 10 ] (LAV)). Este último enfoque requiere inferencias más sofisticadas para resolver una consulta en el esquema mediado, pero facilita la adición de nuevas fuentes de datos a un esquema mediado (estable).
A partir de 2010Parte del trabajo en la investigación de integración de datos se centra en el problema de la integración semántica . Este problema no aborda la estructuración de la arquitectura de la integración, sino cómo resolver conflictos semánticos entre fuentes de datos heterogéneas. Por ejemplo, si dos empresas fusionan sus bases de datos, ciertos conceptos y definiciones en sus respectivos esquemas, como "ganancias", inevitablemente tendrán significados diferentes. En una base de datos puede significar ganancias en dólares (un número de coma flotante), mientras que en la otra podría representar el número de ventas (un número entero). Una estrategia común para la resolución de estos problemas implica el uso de ontologías que definen explícitamente los términos del esquema y, por lo tanto, ayudan a resolver conflictos semánticos. Este enfoque representa la integración de datos basada en ontologías . Por otro lado, el problema de combinar resultados de investigación de diferentes repositorios bioinformáticos requiere la evaluación comparativa de las similitudes, calculadas a partir de diferentes fuentes de datos, en un único criterio, como el valor predictivo positivo. Esto permite que las fuentes de datos sean directamente comparables y se puedan integrar incluso cuando la naturaleza de los experimentos sea distinta. [ 11 ]
A partir de 2011Se determinó que los métodos actuales de modelado de datos estaban generando aislamiento de datos en cada arquitectura de datos en forma de islas de datos dispares y silos de información. Este aislamiento de datos es un artefacto no deseado de la metodología de modelado de datos que resulta en el desarrollo de modelos de datos dispares. Los modelos de datos dispares, cuando se instancian como bases de datos, forman bases de datos dispares. Se han desarrollado metodologías de modelado de datos mejoradas para eliminar el artefacto de aislamiento de datos y promover el desarrollo de modelos de datos integrados. [ 12 ] Un método de modelado de datos mejorado reformula los modelos de datos al aumentarlos con metadatos estructurales en forma de entidades de datos estandarizadas. Como resultado de reformular múltiples modelos de datos, el conjunto de modelos de datos reformulados ahora compartirá una o más relaciones comunes que relacionan los metadatos estructurales ahora comunes a estos modelos de datos. Las relaciones comunes son un tipo de relaciones de entidad de igual a igual que relacionan las entidades de datos estandarizadas de múltiples modelos de datos. Múltiples modelos de datos que contienen la misma entidad de datos estándar pueden participar en la misma relación común. Cuando los modelos de datos integrados se instancian como bases de datos y se rellenan correctamente a partir de un conjunto común de datos maestros, entonces estas bases de datos están integradas.
Desde 2011, los enfoques de centros de datos han despertado mayor interés que los almacenes de datos empresariales totalmente estructurados (generalmente relacionales). Desde 2013, los enfoques de lagos de datos han alcanzado el nivel de los centros de datos. (Véase la popularidad de los tres términos de búsqueda en Google Trends. [ 13 ] ) Estos enfoques combinan datos no estructurados o variados en una sola ubicación, pero no requieren necesariamente un esquema relacional maestro (a menudo complejo) para estructurar y definir todos los datos en el centro.
En los últimos tiempos, el número de aplicaciones en uso se ha multiplicado y la integración entre aplicaciones se ha vuelto fundamental, lo que ha dado lugar a las [API unificadas] que ayudan a los desarrolladores de aplicaciones a integrar sus aplicaciones con otras aplicaciones y, más recientemente, al [MCP - Protocolo de contexto de modelo], que va un paso más allá para los agentes de IA.
La integración de datos juega un papel fundamental en los negocios en lo que respecta a la recopilación de datos utilizados para el estudio del mercado. Convertir los datos brutos obtenidos de los consumidores en datos coherentes es algo que las empresas intentan hacer al considerar los pasos a seguir. [ 14 ] Las organizaciones utilizan cada vez con mayor frecuencia la minería de datos para recopilar información y patrones de sus bases de datos, y este proceso les ayuda a desarrollar nuevas estrategias comerciales para aumentar el rendimiento empresarial y realizar análisis económicos de manera más eficiente. Compilar la gran cantidad de datos que recopilan para almacenarlos en su sistema es una forma de integración de datos adaptada a la inteligencia empresarial para mejorar sus posibilidades de éxito. [ 15 ]
Ejemplo
Imaginemos una aplicación web donde el usuario puede consultar diversa información sobre ciudades (como estadísticas de delincuencia, clima, hoteles, datos demográficos, etc.). Tradicionalmente, esta información debe almacenarse en una única base de datos con un esquema único. Sin embargo, para cualquier empresa, recopilar información de esta magnitud resultaría complejo y costoso. Incluso si se dispusiera de los recursos necesarios, probablemente se duplicaría la información ya existente en bases de datos de delincuencia, sitios web meteorológicos y censos.
Una solución de integración de datos puede abordar este problema considerando estos recursos externos como vistas materializadas sobre un esquema virtual mediado , lo que da como resultado una "integración virtual de datos". Esto significa que los desarrolladores de aplicaciones construyen un esquema virtual —el esquema mediado— para modelar de la mejor manera el tipo de respuestas que sus usuarios desean. A continuación, diseñan adaptadores para cada fuente de datos, como la base de datos de delitos y el sitio web meteorológico. Estos adaptadores simplemente transforman los resultados de las consultas locales (los que devuelven los sitios web o bases de datos correspondientes) en un formato fácilmente procesable para la solución de integración de datos (véase la figura 2). Cuando un usuario de la aplicación consulta el esquema mediado, la solución de integración de datos transforma esta consulta en consultas apropiadas sobre las fuentes de datos correspondientes. Finalmente, la base de datos virtual combina los resultados de estas consultas para dar respuesta a la consulta del usuario.
Esta solución ofrece la comodidad de agregar nuevas fuentes simplemente creando un adaptador o un módulo de software. Se diferencia de los sistemas ETL o de las soluciones de base de datos única, que requieren la integración manual de todo el conjunto de datos nuevo en el sistema. Las soluciones ETL virtuales utilizan esquemas virtuales mediados para implementar la armonización de datos, donde los datos se copian desde la fuente "maestra" designada a los destinos definidos, campo por campo. La virtualización avanzada de datos también se basa en el concepto de modelado orientado a objetos para construir esquemas virtuales mediados o repositorios de metadatos virtuales, utilizando una arquitectura de concentrador y radios .
Cada fuente de datos es independiente y, por lo tanto, no está diseñada para admitir uniones fiables entre ellas. En consecuencia, tanto la virtualización como la federación de datos dependen de la coincidencia fortuita de datos para combinar información de conjuntos de datos dispares. Debido a la falta de coincidencia en los valores de los datos entre las fuentes, el conjunto de resultados puede ser inexacto, incompleto e imposible de validar.
Una solución consiste en reestructurar bases de datos dispares para integrarlas sin necesidad de ETL . Las bases de datos reestructuradas admiten restricciones de uniformidad, lo que permite garantizar la integridad referencial entre ellas. Además, proporcionan rutas de acceso a datos predefinidas con valores de datos comunes entre las bases de datos.
Teoría
La teoría de la integración de datos [ 1 ] constituye un subconjunto de la teoría de bases de datos y formaliza los conceptos subyacentes del problema en lógica de primer orden . La aplicación de estas teorías proporciona indicios sobre la viabilidad y la dificultad de la integración de datos. Si bien sus definiciones pueden parecer abstractas, poseen la suficiente generalidad para abarcar todo tipo de sistemas de integración, [ 16 ] incluyendo aquellos que incorporan bases de datos relacionales/XML anidadas [ 17 ] y aquellos que tratan las bases de datos como programas. [ 18 ] Las conexiones a sistemas de bases de datos específicos, como Oracle o DB2, se proporcionan mediante tecnologías de nivel de implementación como JDBC y no se estudian a nivel teórico.
Definiciones
Los sistemas de integración de datos se definen formalmente como una tupla.dóndees el esquema global (o mediado),es el conjunto heterogéneo de esquemas de origen, yes el mapeo que asigna consultas entre el origen y los esquemas globales. Ambosyse expresan en lenguajes sobre alfabetos compuestos por símbolos para cada una de sus respectivas relaciones . El mapeoconsiste en aserciones entre consultas sobrey consultas sobreCuando los usuarios realizan consultas sobre el sistema de integración de datos, realizan consultas sobrey el mapeo establece entonces conexiones entre los elementos del esquema global y los esquemas de origen.
Una base de datos sobre un esquema se define como un conjunto de conjuntos, uno para cada relación (en una base de datos relacional). La base de datos correspondiente al esquema de origencomprendería el conjunto de conjuntos de tuplas para cada una de las fuentes de datos heterogéneas y se denomina base de datos de origen . Tenga en cuenta que esta única base de datos de origen puede representar en realidad una colección de bases de datos desconectadas. La base de datos correspondiente al esquema mediado virtualSe denomina base de datos global . La base de datos global debe satisfacer la asignación.con respecto a la base de datos de origen. La legalidad de este mapeo depende de la naturaleza de la correspondencia entreyExisten dos formas populares de modelar esta correspondencia: Global como Vista o GAV y Local como Vista o LAV.

Los sistemas GAV modelan la base de datos global como un conjunto de vistas sobre. En este casose asocia a cada elemento deuna consulta sobreEl procesamiento de consultas se convierte en una operación sencilla debido a las asociaciones bien definidas entreyLa complejidad reside en la implementación del código mediador, que instruye al sistema de integración de datos sobre cómo recuperar elementos de las bases de datos de origen. Si se incorporan nuevas fuentes al sistema, puede ser necesario un esfuerzo considerable para actualizar el mediador; por lo tanto, el enfoque GAV parece preferible cuando es improbable que las fuentes cambien.
En un enfoque GAV para el sistema de integración de datos del ejemplo anterior, el diseñador del sistema primero desarrollaría mediadores para cada una de las fuentes de información de la ciudad y luego diseñaría el esquema global en torno a estos mediadores. Por ejemplo, si una de las fuentes proporcionara un sitio web meteorológico, el diseñador probablemente agregaría un elemento correspondiente para el clima al esquema global. Luego, la mayor parte del esfuerzo se concentra en escribir el código del mediador adecuado que transformará los predicados sobre el clima en una consulta sobre el sitio web meteorológico. Este proceso puede volverse complejo si alguna otra fuente también está relacionada con el clima, ya que el diseñador podría necesitar escribir código para combinar correctamente los resultados de ambas fuentes.
Por otro lado, en LAV, la base de datos de origen se modela como un conjunto de vistas sobre. En este casose asocia a cada elemento deuna consulta sobreAquí se muestran las asociaciones exactas entreyya no están bien definidos. Como se ilustra en la siguiente sección, la responsabilidad de determinar cómo recuperar elementos de las fuentes recae en el procesador de consultas. La ventaja de un modelado LAV es que se pueden agregar nuevas fuentes con mucho menos trabajo que en un sistema GAV; por lo tanto, el enfoque LAV debería preferirse en los casos en que el esquema mediado sea menos estable o propenso a cambiar. [ 1 ]
En un enfoque LAV para el sistema de integración de datos del ejemplo anterior, el diseñador del sistema diseña primero el esquema global y luego simplemente introduce los esquemas de las respectivas fuentes de información de la ciudad. Consideremos de nuevo el caso de que una de las fuentes sea un sitio web meteorológico. El diseñador añadiría los elementos correspondientes al esquema global solo si no existieran. A continuación, los programadores escriben un adaptador o envoltorio para el sitio web y añaden una descripción del esquema de los resultados del sitio web a los esquemas de origen. La complejidad de añadir la nueva fuente pasa del diseñador al procesador de consultas.
Procesamiento de consultas
La teoría del procesamiento de consultas en sistemas de integración de datos se expresa comúnmente utilizando consultas conjuntivas y Datalog , un lenguaje de programación lógica puramente declarativo. [ 20 ] Se puede pensar, de forma general, en una consulta conjuntiva como una función lógica aplicada a las relaciones de una base de datos, como por ejemplo:dóndeSi una tupla o un conjunto de tuplas se sustituye en la regla y la satisface (la hace verdadera), entonces consideramos esa tupla como parte del conjunto de respuestas de la consulta. Si bien los lenguajes formales como Datalog expresan estas consultas de forma concisa y sin ambigüedad, las consultas SQL comunes también se consideran consultas conjuntivas.
En términos de integración de datos, la "contención de consultas" representa una propiedad importante de las consultas conjuntivas. Una consultacontiene otra consulta(denotado) si los resultados de la aplicaciónson un subconjunto de los resultados de la aplicaciónpara cualquier base de datos. Se dice que las dos consultas son equivalentes si los conjuntos resultantes son iguales para cualquier base de datos. Esto es importante porque tanto en los sistemas GAV como LAV, un usuario plantea consultas conjuntivas sobre un esquema virtual representado por un conjunto de vistas , o consultas conjuntivas "materializadas". La integración busca reescribir las consultas representadas por las vistas para que sus resultados sean equivalentes o estén contenidos al máximo por la consulta de nuestro usuario. Esto corresponde al problema de responder consultas usando vistas ( AQUV ). [ 21 ]
En los sistemas GAV, el diseñador del sistema escribe el código del mediador para definir la reescritura de consultas. Cada elemento de la consulta del usuario corresponde a una regla de sustitución, al igual que cada elemento del esquema global corresponde a una consulta sobre la fuente. El procesamiento de la consulta simplemente expande los subobjetivos de la consulta del usuario según la regla especificada en el mediador, por lo que es probable que la consulta resultante sea equivalente. Si bien el diseñador realiza la mayor parte del trabajo previamente, algunos sistemas GAV, como Tsimmis, implican la simplificación del proceso de descripción del mediador.
En los sistemas LAV, las consultas se someten a un proceso de reescritura más radical porque no existe un mediador que alinee la consulta del usuario con una estrategia de expansión simple. El sistema de integración debe realizar una búsqueda en el espacio de consultas posibles para encontrar la mejor reescritura. La reescritura resultante puede no ser una consulta equivalente, pero sí estar contenida al máximo, y las tuplas resultantes pueden estar incompletas. A partir de 2011El algoritmo GQR [ 22 ] es el algoritmo de reescritura de consultas líder para sistemas de integración de datos LAV.
En general, la complejidad de la reescritura de consultas es NP-completa . [ 21 ] Si el espacio de reescrituras es relativamente pequeño, esto no supone un problema, incluso para sistemas de integración con cientos de fuentes.
Medicina y ciencias de la vida
Las cuestiones a gran escala en la ciencia, como la evidencia del mundo real , el calentamiento global , la propagación de especies invasoras y el agotamiento de los recursos , requieren cada vez más la recopilación de conjuntos de datos dispares para el metaanálisis . Este tipo de integración de datos es especialmente desafiante para los datos ecológicos y ambientales porque no hay estándares de metadatos acordados y hay muchos tipos de datos diferentes producidos en estos campos. Las iniciativas de la National Science Foundation, como Datanet, tienen como objetivo facilitar la integración de datos para los científicos al proporcionar infraestructura cibernética y establecer estándares. Las cinco iniciativas financiadas por Datanet son DataONE , [ 23 ] dirigida por William Michener en la Universidad de Nuevo México ; The Data Conservancy, [ 24 ] dirigida por Sayeed Choudhury de la Universidad Johns Hopkins ; SEAD: Sustainable Environment through Actionable Data, [ 25 ] dirigida por Margaret Hedstrom de la Universidad de Michigan ; el DataNet Federation Consortium, [ 26 ] dirigido por Reagan Moore de la Universidad de Carolina del Norte ; y Terra Populus , [ 27 ] liderado por Steven Ruggles de la Universidad de Minnesota . La Research Data Alliance , [ 28 ] ha explorado más recientemente la creación de marcos de integración de datos globales. El proyecto OpenPHACTS , financiado a través de la Iniciativa de Medicamentos Innovadores de la Unión Europea , construyó una plataforma de descubrimiento de fármacos mediante la vinculación de conjuntos de datos de proveedores como el Instituto Europeo de Bioinformática , la Real Sociedad de Química , UniProt , WikiPathways y DrugBank .
Véase también
- gestión de la semántica empresarial
- Captura de datos de cambios
- Integración de datos básicos
- Integración de datos de clientes
- Ciberinfraestructura
- Combinación de datos
- Curación de datos
- Fusión de datos
- Mapeo de datos
- Manipulación de datos
- Modelo de base de datos
- Espacios de datos
- Integración de datos en el borde
- Integración de aplicaciones empresariales
- Marco de arquitectura empresarial
- Integración de la información empresarial (EII)
- Integración empresarial
- Geodi: Integración de datos geocientíficos
- Integración de la información
- silo de información
- Centro de Competencia para la Integración
- Consorcio de Integración
- ISO 15926 : Integración de datos del ciclo de vida para plantas de proceso, incluidas las instalaciones de producción de petróleo y gas.
- JXTA
- Gestión de datos maestros
- Mapeo objeto-relacional
- Abrir texto
- Integración semántica
- Coincidencia de esquemas
- Enfoque de tres esquemas
- UDEF
- Integración de datos web
- Servicio web
Referencias
- 1 2 3 Maurizio Lenzerini (2002). "Integración de datos: una perspectiva teórica" (PDF) . PODS 2002. págs. 233–246 .
- ↑ Frederick Lane (2006). "IDC: El mundo creó 161 mil millones de gigabytes de datos en 2006" . Archivado del original el 15 de julio de 2015.
- ↑ mikben. "Coherencia de datos - Aplicaciones Win32" . docs.microsoft.com . Archivado del original el 12 de junio de 2020. Consultado el 23 de noviembre de 2020 .
- ↑ Chung, P.; Chung, SH (2013-05). "Sobre la integración de datos y la minería de datos para el desarrollo de inteligencia empresarial". 2013 IEEE Long Island Systems, Applications and Technology Conference (LISAT) : 1–6. doi : 10.1109/LISAT.2013.6578235.
- ↑ John Miles Smith; et al. (1982). "Multibase: integración de sistemas de bases de datos distribuidas heterogéneas" . Actas de la Conferencia Nacional de Computación AFIPS '81, del 4 al 7 de mayo de 1981. págs. 487–499 .
- ↑ Steven Ruggles , J. David Hacker y Matthew Sobek (1995). "Orden a partir del caos: la serie integrada de microdatos de uso público". Métodos históricos . Vol. 28. págs. 33–39 .
{{cite news}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Jennifer Widom (1995). "Problemas de investigación en el almacenamiento de datos" . CIKM '95 Actas de la Cuarta Conferencia Internacional sobre Gestión de la Información y el Conocimiento . págs. 25–30 .
- ↑ Pautasso, Cesare; Wilde, Erik (2009-04-20). "¿Por qué la web está débilmente acoplada?" . Actas de la 18.ª conferencia internacional sobre la World Wide Web . WWW '09. Madrid, España: Association for Computing Machinery. pp. 911–920 . doi : 10.1145/1526709.1526832 . ISBN 978-1-60558-487-4. S2CID 207172208 .
- ↑ "¿Qué es GAV (Global as View)?" . GeeksforGeeks . 18 de abril de 2020. Archivado del original el 30 de noviembre de 2020. Consultado el 23 de noviembre de 2020 .
- ↑ "Local-as-View" , Wikipedia (en alemán), 24 de julio de 2020 , consultado el 23 de noviembre de 2020.
- ↑ Shubhra S. Ray; et al. (2009). "Combinación de información de múltiples fuentes mediante ponderación basada en anotaciones funcionales: predicción de la función genética en levaduras" ( PDF) . IEEE Transactions on Biomedical Engineering . 56 (2): 229– 236. Bibcode : 2009ITBE...56..229S . CiteSeerX 10.1.1.150.7928 . doi : 10.1109/TBME.2008.2005955 . PMID 19272921. S2CID 10848834. Archivado (PDF) del original el 8 de mayo de 2010. Recuperado el 17 de mayo de 2012 .
- ↑ Michael Mireku Kwakye (2011). "Un enfoque práctico para fusionar modelos de datos multidimensionales". hdl : 10393/20457 .
- ↑ "Tendencias de búsqueda en Hub Lake y Warehouse" . Archivado del original el 17 de febrero de 2017. Consultado el 12 de enero de 2016 .
- ↑ "Minería de datos en análisis de negocios" . Western Governors University . 15 de mayo de 2020. Archivado del original el 23 de diciembre de 2020. Consultado el 22 de noviembre de 2020 .
- ↑ Surani, Ibrahim (30 de marzo de 2020). "Integración de datos para inteligencia empresarial: mejores prácticas" . DATAVERSITY . Archivado del original el 30 de noviembre de 2020. Consultado el 23 de noviembre de 2020 .
- ↑ Alagić, Suad; Bernstein, Philip A. (2002). Lenguajes de programación de bases de datos . Lecture Notes in Computer Science. Vol. 2397. pp. 228–246 . doi : 10.1007/3-540-46093-4_14 . ISBN 978-3-540-44080-2.
- ↑ "Asignaciones anidadas: Esquema de asignación recargado" (PDF) . Archivado (PDF) del original el 28-10-2015 . Recuperado el 10-09-2015 .
- ↑ "La iniciativa del marco común para la especificación algebraica y el desarrollo de software" (PDF) . Archivado (PDF) del original el 4 de marzo de 2016. Consultado el 10 de septiembre de 2015 .
- ↑ Christoph Koch (2001). "Integración de datos frente a múltiples esquemas autónomos en evolución" (PDF) . Archivado del original (PDF) el 26 de septiembre de 2007.
- ↑ Jeffrey D. Ullman (1997). "Integración de información mediante vistas lógicas" . ICDT 1997. págs. 19–40 .
- 1 2 Alon Y. Halevy (2001). "Responder consultas usando vistas: una revisión" (PDF) . The VLDB Journal . págs. 270–294 .
- ↑ George Konstantinidis; et al. (2011). "Reescritura de consultas escalable: un enfoque basado en grafos" (PDF) . En Actas de la Conferencia Internacional ACM SIGMOD sobre Gestión de Datos, SIGMOD'11, 12-16 de junio de 2011, Atenas, Grecia .
- ↑ William Michener; et al. "DataONE: Red de Observación para la Tierra" . www.dataone.org. Archivado del original el 22 de enero de 2013. Consultado el 19 de enero de 2013 .
- ↑ Sayeed Choudhury; et al. "Data Conservancy" . dataconservancy.org. Archivado del original el 13 de enero de 2013. Consultado el 19 de enero de 2013 .
- ↑ Margaret Hedstrom ; et al. "SEAD Medio Ambiente Sostenible - Datos Aplicables" . sead-data.net. Archivado del original el 20 de septiembre de 2012. Consultado el 19 de enero de 2013 .
- ↑ Reagan Moore ; et al. "DataNet Federation Consortium" . datafed.org. Archivado del original el 15 de abril de 2013. Consultado el 19 de enero de 2013 .
- ↑ Steven Ruggles ; et al. "Terra Populus: Datos integrados sobre población y medio ambiente" . terrapop.org. Archivado del original el 18 de mayo de 2013. Consultado el 19 de enero de 2013 .
- ↑ Bill Nichols. "Research Data Alliance" . rd-alliance.org. Archivado del original el 18 de noviembre de 2014. Consultado el 1 de octubre de 2014 .
Enlaces externos
- Integración de datos
- Ciberinfraestructura
- Gestión de datos
- Modelos de bases de datos