
El modelado de datos en ingeniería de software es el proceso de crear un modelo de datos para un sistema de información mediante la aplicación de ciertas técnicas formales. Puede aplicarse como parte del concepto más amplio de ingeniería dirigida por modelos (MDE).
Descripción general
El modelado de datos es un proceso utilizado para definir y analizar los requisitos de datos necesarios para respaldar los procesos de negocio dentro del alcance de los sistemas de información correspondientes en las organizaciones. Por lo tanto, el proceso de modelado de datos involucra a modeladores de datos profesionales que trabajan en estrecha colaboración con las partes interesadas del negocio, así como con los usuarios potenciales del sistema de información. Existen tres tipos diferentes de modelos de datos producidos a medida que se avanza desde los requisitos hasta la base de datos real que se utilizará para el sistema de información. [ 2 ] Los requisitos de datos se registran inicialmente como un modelo de datos conceptual, que es esencialmente un conjunto de especificaciones independientes de la tecnología sobre los datos y se utiliza para discutir los requisitos iniciales con las partes interesadas del negocio. El modelo conceptual se traduce luego en un modelo de datos lógico , que documenta las estructuras de los datos que se pueden implementar en las bases de datos. La implementación de un modelo de datos conceptual puede requerir múltiples modelos de datos lógicos. El último paso en el modelado de datos es transformar el modelo de datos lógico en un modelo de datos físico que organiza los datos en tablas y considera los detalles de acceso, rendimiento y almacenamiento. El modelado de datos define no solo los elementos de datos, sino también sus estructuras y las relaciones entre ellos. [ 3 ]
Las técnicas y metodologías de modelado de datos se utilizan para modelar datos de manera estándar, consistente y predecible, con el fin de gestionarlos como un recurso. Se recomienda encarecidamente el uso de estándares de modelado de datos para todos los proyectos que requieran un método estándar para definir y analizar datos dentro de una organización, por ejemplo, mediante el modelado de datos:
- para ayudar a analistas de negocios, programadores, evaluadores, redactores de manuales, selectores de paquetes de TI, ingenieros, gerentes, organizaciones relacionadas y clientes a comprender y utilizar un modelo semiformal acordado que abarca los conceptos de la organización y cómo se relacionan entre sí.
- gestionar los datos como un recurso
- integrar sistemas de información
- diseñar bases de datos/ almacenes de datos (también conocidos como repositorios de datos)
El modelado de datos puede realizarse durante varios tipos de proyectos y en múltiples fases de los mismos. Los modelos de datos son progresivos; no existe un modelo de datos final para un negocio o aplicación. En cambio, un modelo de datos debe considerarse un documento vivo que cambiará en respuesta a los cambios del negocio. Idealmente, los modelos de datos deberían almacenarse en un repositorio para que puedan recuperarse, ampliarse y editarse con el tiempo. Whitten et al. (2004) determinaron dos tipos de modelado de datos: [ 4 ]
- Modelado estratégico de datos: Esto forma parte de la creación de una estrategia de sistemas de información, que define una visión y arquitectura generales para dichos sistemas. La ingeniería de tecnologías de la información es una metodología que adopta este enfoque.
- Modelado de datos durante el análisis de sistemas: En el análisis de sistemas, se crean modelos de datos lógicos como parte del desarrollo de nuevas bases de datos.
El modelado de datos también se utiliza como técnica para detallar los requisitos empresariales de bases de datos específicas . A veces se le llama modelado de bases de datos porque, finalmente, un modelo de datos se implementa en una base de datos. [ 4 ]
Temas
Modelos de datos

Los modelos de datos proporcionan un marco para el uso de datos en sistemas de información, al ofrecer definiciones y formatos específicos. Si un modelo de datos se utiliza de forma coherente en todos los sistemas, se logra la compatibilidad de los datos. Si se utilizan las mismas estructuras de datos para almacenar y acceder a ellos, diferentes aplicaciones pueden compartirlos sin problemas. Los resultados se muestran en el diagrama. Sin embargo, los sistemas e interfaces suelen ser costosos de construir, operar y mantener. Además, pueden limitar el negocio en lugar de apoyarlo. Esto puede ocurrir cuando la calidad de los modelos de datos implementados en los sistemas e interfaces es deficiente. [ 1 ]
Algunos problemas comunes que se encuentran en los modelos de datos son:
- Las reglas de negocio, específicas de cómo se realizan las tareas en un lugar determinado, suelen estar integradas en la estructura del modelo de datos. Esto significa que pequeños cambios en la forma de operar conllevan grandes modificaciones en los sistemas informáticos y las interfaces. Por lo tanto, es necesario implementar las reglas de negocio de forma flexible, evitando dependencias complejas. En cambio, el modelo de datos debe ser lo suficientemente flexible como para que los cambios en el negocio puedan implementarse de forma relativamente rápida y eficiente.
- Con frecuencia, los tipos de entidades no se identifican o se identifican incorrectamente. Esto puede provocar la duplicación de datos, estructuras de datos y funcionalidades, con los consiguientes costes de desarrollo y mantenimiento. Por lo tanto, las definiciones de datos deben ser lo más explícitas y fáciles de entender posible para minimizar las malas interpretaciones y la duplicación.
- Los modelos de datos para distintos sistemas son arbitrariamente diferentes. Esto implica la necesidad de interfaces complejas entre los sistemas que comparten datos. Estas interfaces pueden representar entre el 25 % y el 70 % del coste de los sistemas actuales. Al diseñar un modelo de datos, es fundamental considerar las interfaces necesarias, ya que un modelo de datos por sí solo no sería útil sin las interfaces entre los diferentes sistemas.
- Los datos no pueden compartirse electrónicamente con clientes y proveedores, ya que su estructura y significado no están estandarizados. Para obtener el máximo provecho de un modelo de datos implementado, es fundamental definir estándares que garanticen que los modelos de datos satisfagan las necesidades del negocio y sean coherentes. [ 1 ]
Esquemas conceptuales, lógicos y físicos

En 1975, ANSI describió tres tipos de instancias de modelos de datos : [ 5 ]
- Esquema conceptual : describe la semántica de un dominio (el alcance del modelo). Por ejemplo, puede ser un modelo del área de interés de una organización o de una industria. Este esquema consta de clases de entidades, que representan tipos de elementos relevantes en el dominio, y aserciones de relaciones sobre asociaciones entre pares de clases de entidades. Un esquema conceptual especifica los tipos de hechos o proposiciones que se pueden expresar utilizando el modelo. En ese sentido, define las expresiones permitidas en un "lenguaje" artificial cuyo alcance está limitado por el alcance del modelo. En resumen, un esquema conceptual es el primer paso para organizar los requisitos de datos.
- Esquema lógico : describe la estructura de un dominio de información. Consiste en descripciones de (por ejemplo) tablas, columnas, clases orientadas a objetos y etiquetas XML. El esquema lógico y el esquema conceptual a veces se implementan como uno solo. [ 2 ]
- Esquema físico : describe los medios físicos utilizados para almacenar datos. Esto incluye particiones, CPU, espacios de tablas y similares.
Según ANSI, este enfoque permite que las tres perspectivas sean relativamente independientes entre sí. La tecnología de almacenamiento puede cambiar sin afectar ni al esquema lógico ni al conceptual. La estructura de tablas y columnas puede cambiar sin afectar (necesariamente) al esquema conceptual. En cada caso, por supuesto, las estructuras deben mantenerse consistentes en todos los esquemas del mismo modelo de datos.
Proceso de modelado de datos

En el contexto de la integración de procesos de negocio (véase la figura), el modelado de datos complementa el modelado de procesos de negocio y, en última instancia, da como resultado la generación de bases de datos. [ 6 ]
El proceso de diseño de una base de datos implica la creación de los tres tipos de esquemas descritos anteriormente: conceptual, lógico y físico. El diseño de la base de datos documentado en estos esquemas se convierte mediante un lenguaje de definición de datos (DDL ), que luego se utiliza para generar la base de datos. Un modelo de datos con atributos completos contiene atributos detallados (descripciones) para cada entidad. El término "diseño de base de datos" puede describir diversas partes del diseño de un sistema de base de datos . Principalmente, y de forma más precisa, se puede considerar como el diseño lógico de las estructuras de datos básicas utilizadas para almacenar la información. En el modelo relacional, estas son las tablas y las vistas . En una base de datos orientada a objetos , las entidades y las relaciones se corresponden directamente con las clases de objetos y las relaciones con nombre. Sin embargo, el término "diseño de base de datos" también puede aplicarse al proceso general de diseño, no solo de las estructuras de datos básicas, sino también de los formularios y las consultas que forman parte de la aplicación de base de datos dentro del Sistema de Gestión de Bases de Datos (DBMS).
En este proceso, las interfaces del sistema representan entre el 25 % y el 70 % de los costos de desarrollo y soporte de los sistemas actuales. La razón principal de este costo es que estos sistemas no comparten un modelo de datos común . Si los modelos de datos se desarrollan sistema por sistema, no solo se repite el mismo análisis en áreas superpuestas, sino que también se debe realizar un análisis adicional para crear las interfaces entre ellos. La mayoría de los sistemas dentro de una organización contienen los mismos datos básicos, rediseñados para un propósito específico. Por lo tanto, un modelo de datos básico diseñado de manera eficiente puede minimizar el retrabajo con modificaciones mínimas para los propósitos de los diferentes sistemas dentro de la organización [ 1 ].
Metodologías de modelado
Los modelos de datos representan áreas de información de interés. Si bien existen muchas maneras de crear modelos de datos, según Len Silverston (1997) [ 7 ], solo dos metodologías de modelado destacan: de arriba hacia abajo y de abajo hacia arriba:
- Los modelos ascendentes o de integración de vistas suelen ser el resultado de un esfuerzo de reingeniería . Generalmente parten de estructuras de datos existentes, como formularios, campos en pantallas de aplicaciones o informes. Estos modelos suelen ser físicos, específicos de la aplicación e incompletos desde una perspectiva empresarial . Es posible que no fomenten el intercambio de datos, especialmente si se construyen sin tener en cuenta otras partes de la organización. [ 7 ]
- Por otro lado, los modelos de datos lógicos descendentes se crean de forma abstracta a partir de información proporcionada por personas expertas en el área temática. Un sistema puede no implementar todas las entidades de un modelo lógico, pero este sirve como punto de referencia o plantilla. [ 7 ]
En ocasiones, los modelos se crean mediante una combinación de ambos métodos: considerando las necesidades de datos y la estructura de una aplicación, y haciendo referencia de forma consistente a un modelo de área temática. En muchos entornos, la distinción entre un modelo de datos lógico y un modelo de datos físico se difumina. Además, algunas herramientas CASE no distinguen entre modelos de datos lógicos y físicos . [ 7 ]
Diagramas entidad-relación

Existen diversas notaciones para el modelado de datos. El modelo propiamente dicho se denomina frecuentemente "modelo entidad-relación", ya que representa los datos en términos de las entidades y relaciones descritas en ellos . [ 4 ] Un modelo entidad-relación (MER) es una representación conceptual abstracta de datos estructurados. El modelado entidad-relación es un método de modelado de bases de datos de esquema relacional , utilizado en ingeniería de software para producir un tipo de modelo de datos conceptual (o modelo de datos semántico ) de un sistema, a menudo una base de datos relacional , y sus requisitos de forma descendente .
Estos modelos se utilizan en la primera etapa del diseño de sistemas de información , durante el análisis de requisitos, para describir las necesidades de información o el tipo de información que se almacenará en una base de datos . La técnica de modelado de datos puede utilizarse para describir cualquier ontología (es decir, una visión general y clasificaciones de los términos utilizados y sus relaciones) para un universo de discurso determinado , es decir, el área de interés.
Se han desarrollado varias técnicas para el diseño de modelos de datos. Si bien estas metodologías guían a los modeladores de datos en su trabajo, dos personas diferentes que utilicen la misma metodología a menudo obtendrán resultados muy diferentes. Las más destacadas son:
Modelado de datos genérico

Los modelos de datos genéricos son generalizaciones de los modelos de datos convencionales . Definen tipos de relaciones generales estandarizados, junto con los tipos de elementos que pueden relacionarse mediante dichos tipos de relaciones. La definición de un modelo de datos genérico es similar a la de un lenguaje natural. Por ejemplo, un modelo de datos genérico puede definir tipos de relaciones como una «relación de clasificación», que es una relación binaria entre un elemento individual y un tipo de elemento (una clase), y una «relación parte-todo», que es una relación binaria entre dos elementos, uno con el rol de parte y el otro con el rol de todo, independientemente del tipo de elementos que se relacionen.
Dada una lista extensible de clases, esto permite clasificar cualquier elemento y especificar relaciones de parte-todo para cualquier objeto. Mediante la estandarización de una lista extensible de tipos de relaciones, un modelo de datos genérico posibilita la expresión de un número ilimitado de tipos de hechos y se aproxima a las capacidades de los lenguajes naturales. Los modelos de datos convencionales, por otro lado, tienen un dominio fijo y limitado, ya que su instanciación (uso) solo permite expresar tipos de hechos predefinidos en el modelo.
Modelado de datos semánticos
La estructura lógica de datos de un sistema de gestión de bases de datos (DBMS), ya sea jerárquica, de red o relacional, no puede satisfacer completamente los requisitos de una definición conceptual de datos, dado su alcance limitado y su sesgo hacia la estrategia de implementación empleada por el DBMS. Esto no aplica a menos que el modelo de datos semántico se implemente intencionadamente en la base de datos, una decisión que puede afectar ligeramente el rendimiento, pero que generalmente mejora enormemente la productividad.

Por lo tanto, la necesidad de definir los datos desde una perspectiva conceptual ha llevado al desarrollo de técnicas de modelado de datos semánticos . Es decir, técnicas para definir el significado de los datos en el contexto de sus interrelaciones con otros datos. Como se ilustra en la figura, el mundo real, en términos de recursos, ideas, eventos, etc., se define simbólicamente mediante su descripción en almacenes de datos físicos. Un modelo de datos semántico es una abstracción que define cómo se relacionan los símbolos almacenados con el mundo real. Por consiguiente, el modelo debe ser una representación fiel del mundo real. [ 8 ]
El propósito del modelado de datos semánticos es crear un modelo estructural de una parte del mundo real, denominada "universo del discurso". Para ello, se consideran tres relaciones estructurales fundamentales:
- Clasificación/instanciación: Los objetos con cierta similitud estructural se describen como instancias de clases.
- Agregación/descomposición: Los objetos compuestos se obtienen uniendo sus partes.
- Generalización/especialización: Las clases distintas con algunas propiedades comunes se reconsideran en una clase más genérica con los atributos comunes.
Un modelo de datos semántico puede utilizarse para servir a muchos propósitos, tales como: [ 8 ]
- Planificación de recursos de datos
- Creación de bases de datos compartibles
- Evaluación del software del proveedor
- Integración de bases de datos existentes
El objetivo general de los modelos de datos semánticos es capturar un mayor significado de los datos mediante la integración de conceptos relacionales con conceptos de abstracción más potentes propios del campo de la inteligencia artificial . La idea es proporcionar primitivas de modelado de alto nivel como partes integrales de un modelo de datos para facilitar la representación de situaciones del mundo real. [ 10 ]
Véase también
- Patrón arquitectónico : estructuras de alto nivel de un sistema de software. Páginas que muestran breves descripciones de destinos de redirección.
- Comparación de herramientas de modelado de datos : comparación de herramientas de modelado de datos destacadas
- Datos (informática) : representación discreta y discontinua de información. Páginas que muestran breves descripciones de destinos de redireccionamiento.
- Diccionario de datos : conjunto de metadatos que contiene definiciones y representaciones de elementos de datos.
- Modelado de documentos : tipo de modelo de datos. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Modelado de datos empresariales
- Modelo de datos de entidad : marco de mapeo objeto-relacional de código abierto. Páginas que muestran breves descripciones de destinos de redirección.
- Gestión de la información : actividad organizativa relacionada con el ciclo de vida de la información.
- Modelo de información : visualización en ingeniería de software
- Modelado de información de construcción : proceso para la gestión digital de activos construidos.
- Modelado de metadatos
- Enfoque de tres esquemas : Enfoque para la construcción de sistemas de información
- Marco de Zachman : Estructura para la arquitectura empresarial
Referencias
- 1 2 3 4 5 6 Matthew West y Julian Fowler (1999). Desarrollo de modelos de datos de alta calidad. Archivado el 9 de septiembre de 2020 en Wayback Machine . El Ejecutivo de Enlace Técnico STEP de las Industrias de Procesos Europeas (EPISTLE).
- 1 2 Simison, Graeme C. y Witt, Graham C. (2005). Fundamentos del modelado de datos . 3.ª edición. Morgan Kaufmann Publishers . ISBN 0-12-644551-6
- ↑ Glosario de integración de datos Archivado el 20 de marzo de 2009 en Wayback Machine , Departamento de Transporte de EE. UU., agosto de 2001.
- 1 2 3 Whitten, Jeffrey L .; Lonnie D. Bentley , Kevin C. Dittman . (2005). Métodos de análisis y diseño de sistemas . 6.ª edición. ISBN 0-256-19906-X.
- ↑ Instituto Nacional Estadounidense de Estándares. 1975. Grupo de estudio ANSI/X3/SPARC sobre sistemas de gestión de bases de datos; Informe provisional . FDT (Boletín de ACM SIGMOD) 7:2.
- 1 2 Paul R. Smith y Richard Sarfaty (1993). Creación de un plan estratégico para la gestión de la configuración utilizando herramientas de ingeniería de software asistida por computadora (CASE). Documento para el Grupo Nacional de Usuarios de CAD/CAE de Contratistas e Instalaciones del DOE de 1993.
- 1 2 3 4 Len Silverston, W.H. Inmon, Kent Graziano (2007). The Data Model Resource Book . Wiley, 1997. ISBN 0-471-15364-8Reseña de Van Scott en tdan.com . Consultada el 1 de noviembre de 2008.
- 1 2 3 4 Publicación FIPS 184 Archivada el 3 de diciembre de 2013 en la Wayback Machine publicada de IDEF1X por el Laboratorio de Sistemas Informáticos del Instituto Nacional de Estándares y Tecnología (NIST). 21 de diciembre de 1993.
- ↑ Amnon Shabo (2006). Estándares de datos de genómica clínica para farmacogenética y farmacogenómica. Archivado el 22 de julio de 2009 en Wayback Machine .
- ↑ "Modelado de datos semánticos" En: Metaclases y su aplicación . Serie de libros Lecture Notes in Computer Science. Editorial Springer Berlin / Heidelberg. Volumen 943/1995.
Este artículo incorpora material de dominio público del Instituto Nacional de Estándares y Tecnología.
Lecturas adicionales
- ter Bekke, Johannes Hendrikus (4 de junio de 1991). Modelado de datos semánticos en entornos relacionales (PDF) (tesis doctoral). Universidad Técnica de Delft. Archivado (PDF) desde el original el 2 de abril de 2025 . Consultado el 2 de abril de 2025 .
- John Vincent Carlis, Joseph D. Maguire (2001). Dominando el modelado de datos: un enfoque impulsado por el usuario .
- Alan Chmura, J. Mark Heumann (2005). Modelado lógico de datos: qué es y cómo hacerlo .
- Martin E. Modell (1992). Análisis de datos, modelado de datos y clasificación .
- M. Papazoglou, Stefano Spaccapietra, Zahir Tari (2000). Avances en el modelado de datos orientado a objetos .
- G. Lawrence Sanders (1995). Modelado de datos
- Graeme C. Simsion, Graham C. Witt (2005). Fundamentos del modelado de datos.
- Matthew West (2011) Desarrollo de modelos de datos de alta calidad
Enlaces externos
- Modelado de datos ágil/evolutivo
- Artículos sobre modelado de datos archivados el 7 de marzo de 2010 en Wayback Machine .
- Modelado de bases de datos en UML
- Introducción al modelado de datos
- Modelado de datos semánticos
- Desarrollo de sistemas, metodologías y modelado. Archivado el 7 de marzo de 2012 en Wayback Machine . Notas de Tony Drewry.
- Solicitud de propuestas - Metamodelo de gestión de la información (IMM) del Grupo de gestión de objetos
- El modelado de datos NO es solo para sistemas de gestión de bases de datos (DBMS) - Parte 1 - Chris Bradley
- El modelado de datos NO es solo para sistemas de gestión de bases de datos (DBMS) - Parte 2 - Chris Bradley
- Modelado de datos
- Modelado conceptual