Articulo de referencia

Minería de datos de Oracle

Oracle Data Mining (ODM) es una opción de Oracle Database Enterprise Edition. Incluye diversos algoritmos de minería y análisis de datos para clasificación , predicción , regres...

Oracle Data Mining (ODM) es una opción de Oracle Database Enterprise Edition. Incluye diversos algoritmos de minería y análisis de datos para clasificación , predicción , regresión , asociaciones , selección de características , detección de anomalías , extracción de características y análisis especializados. Proporciona herramientas para la creación, gestión e implementación operativa de modelos de minería de datos dentro del entorno de la base de datos.

Descripción general

Oracle Corporation ha implementado diversos algoritmos de minería de datos en su base de datos relacional Oracle Database . Estas implementaciones se integran directamente con el núcleo de la base de datos Oracle y operan de forma nativa sobre los datos almacenados en las tablas relacionales . Esto elimina la necesidad de extraer o transferir datos a servidores de minería/análisis independientes . La plataforma de base de datos relacional se utiliza para gestionar modelos de forma segura y ejecutar consultas SQL de manera eficiente sobre grandes volúmenes de datos. El sistema se organiza en torno a unas pocas operaciones genéricas que proporcionan una interfaz unificada para las funciones de minería de datos . Estas operaciones incluyen funciones para crear , aplicar , probar y manipular modelos de minería de datos . Los modelos se crean y almacenan como objetos de base de datos , y su gestión se realiza dentro de la base de datos, de forma similar a las tablas, vistas, índices y otros objetos de base de datos.

En minería de datos, el proceso de usar un modelo para obtener predicciones o descripciones de comportamientos futuros se denomina "puntuación". En los entornos de análisis tradicionales, un modelo creado en el motor analítico debe implementarse en un sistema crítico para puntuar nuevos datos, o bien los datos se transfieren de tablas relacionales al entorno de análisis; la mayoría de estos entornos ofrecen interfaces de puntuación propietarias. ODM simplifica la implementación de modelos al ofrecer funciones de Oracle SQL para puntuar datos almacenados directamente en la base de datos. De esta forma, el usuario o desarrollador de la aplicación puede aprovechar todo el potencial de Oracle SQL: la capacidad de procesar y manipular los resultados en varios niveles, así como la paralelización y partición del acceso a los datos para optimizar el rendimiento.

Los modelos se pueden crear y gestionar mediante diversos métodos. Oracle Data Miner proporciona una interfaz gráfica de usuario que guía al usuario a través del proceso de creación, prueba y aplicación de modelos (por ejemplo, siguiendo la metodología CRISP-DM ). Los desarrolladores de aplicaciones y herramientas pueden integrar capacidades de minería predictiva y descriptiva mediante PL/SQL o API de Java . Los analistas de negocio pueden experimentar rápidamente con el análisis predictivo o demostrar su potencial utilizando Oracle Spreadsheet Add-In for Predictive Analytics, una interfaz adaptadora específica para Microsoft Excel . ODM ofrece una selección de enfoques de aprendizaje automático conocidos, como árboles de decisión , Naive Bayes , máquinas de vectores de soporte , modelo lineal generalizado (GLM) para minería predictiva, reglas de asociación , K-means y partición ortogonal [ 1 ] [ 2 ] , agrupamiento y factorización de matrices no negativas para minería descriptiva. También se proporciona una técnica basada en la longitud mínima de descripción para clasificar la importancia relativa de los atributos de minería de entrada para un problema dado. La mayoría de las funciones de minería de datos de Oracle también permiten la minería de texto, ya que aceptan atributos de texto ( datos no estructurados ) como entrada. Los usuarios no necesitan configurar las opciones de minería de texto; la opción de base de datos Database_options se encarga de ello automáticamente.

Historia

Oracle Data Mining se presentó por primera vez en 2002 y sus versiones se nombran según la versión correspondiente de la base de datos Oracle:

  • Oracle Data Mining 9iR2 (9.2.0.1.0 - mayo de 2002)
  • Oracle Data Mining 10gR1 (10.1.0.2.0 - febrero de 2004)
  • Oracle Data Mining 10gR2 (10.2.0.1.0 - julio de 2005)
  • Oracle Data Mining 11gR1 (11.1 - septiembre de 2007)
  • Oracle Data Mining 11gR2 (11.2 - septiembre de 2009)

Oracle Data Mining es el sucesor lógico del conjunto de herramientas de minería de datos Darwin, desarrollado por Thinking Machines Corporation a mediados de la década de 1990 y distribuido posteriormente por Oracle tras su adquisición de Thinking Machines en 1999. Sin embargo, el producto en sí es un rediseño y una reescritura completos desde cero : mientras que Darwin era un entorno de trabajo analítico clásico basado en una interfaz gráfica de usuario (GUI), ODM ofrece una plataforma de desarrollo e implementación de minería de datos integrada en la base de datos Oracle, junto con la interfaz gráfica de usuario de Oracle Data Miner.

La nueva interfaz gráfica de usuario (GUI) de flujo de trabajo de Oracle Data Miner 11gR2 se presentó en Oracle Open World 2009. En 2012 se lanzó una versión actualizada de la GUI de Oracle Data Miner. Es gratuita y está disponible como extensión para Oracle SQL Developer 3.1.

Funcionalidad

A partir de la versión 11gR1, Oracle Data Mining incluye las siguientes funciones de minería de datos :

Fuentes de entrada y preparación de datos

La mayoría de las funciones de minería de datos de Oracle aceptan como entrada una tabla o vista relacional. Los datos planos se pueden combinar con datos transaccionales mediante columnas anidadas, lo que permite analizar datos con relaciones de uno a muchos (por ejemplo, un esquema en estrella ). Se puede utilizar toda la funcionalidad de SQL al preparar los datos para la minería de datos, incluyendo fechas y datos espaciales.

Oracle Data Mining distingue entre atributos numéricos, categóricos y no estructurados (texto). El producto también proporciona utilidades para los pasos de preparación de datos previos a la creación del modelo, como el tratamiento de valores atípicos , la discretización , la normalización y la agrupación ( clasificación en términos generales).

Interfaz gráfica de usuario: Oracle Data Miner

Los usuarios pueden acceder a Oracle Data Mining mediante Oracle Data Miner, una aplicación cliente con interfaz gráfica de usuario (GUI ) que proporciona acceso a las funciones de minería de datos y a plantillas estructuradas (denominadas Actividades de Minería) que prescriben automáticamente el orden de las operaciones, realizan las transformaciones de datos necesarias y configuran los parámetros del modelo. La interfaz de usuario también permite la generación automatizada de código Java y/o SQL asociado a las actividades de minería de datos . El Generador de Código Java es una extensión de Oracle JDeveloper . También existe una interfaz independiente: el Complemento de Hoja de Cálculo para Análisis Predictivo, que permite acceder al paquete PL/SQL de Análisis Predictivo de Oracle Data Mining desde Microsoft Excel .

A partir de la versión 11.2 de la base de datos Oracle , Oracle Data Miner se integra con Oracle SQL Developer . [ 3 ]

Interfaces PL/SQL y Java

Oracle Data Mining proporciona un paquete PL/SQL nativo (DBMS_DATA_MINING) para crear, destruir, describir, aplicar, probar, exportar e importar modelos. El siguiente código ilustra una llamada típica para construir un modelo de clasificación :

BEGIN DBMS_DATA_MINING . CREATE_MODEL ( model_name => 'credit_risk_model' , function => DBMS_DATA_MINING . classification , data_table_name => 'credit_card_data' , case_id_column_name => 'customer_id' , target_column_name => 'credit_risk' , settings_table_name => 'credit_risk_model_settings' ); END ;

donde 'credit_risk_model' es el nombre del modelo, creado con el propósito expreso de clasificar el 'riesgo crediticio' de los futuros clientes, basándose en los datos de entrenamiento proporcionados en la tabla 'credit_card_data', distinguiendo cada caso por un 'customer_id' único, con el resto de los parámetros del modelo especificados a través de la tabla 'credit_risk_model_settings'.

Oracle Data Mining también admite una API de Java que cumple con el estándar Java Data Mining (JDM) para la minería de datos (JSR-73), lo que permite la integración con aplicaciones web y Java EE y facilita la portabilidad entre plataformas.

funciones de puntuación SQL

A partir de la versión 10gR2, Oracle Data Mining incluye funciones SQL integradas para la puntuación de modelos de minería de datos. Estas funciones de una sola fila admiten clasificación, regresión, detección de anomalías, agrupamiento y extracción de características. El siguiente código ilustra un uso típico de un modelo de clasificación :

SELECCIONAR customer_name DE credit_card_data DONDE PREDICTION ( credit_risk_model USING * ) = 'LOW' Y customer_value = 'HIGH' ;

PMML

En la versión 11gR2 (11.2.0.2), ODM admite la importación de archivos PMML creados externamente para algunos de los modelos de minería de datos. PMML es un estándar basado en XML para representar modelos de minería de datos.

Complemento de Microsoft Excel para análisis predictivo

El paquete PL/SQL DBMS_PREDICTIVE_ANALYTICS automatiza el proceso de minería de datos, incluyendo el preprocesamiento de datos , la creación y evaluación de modelos, y la puntuación de nuevos datos. La operación PREDICT se utiliza para predecir valores objetivo, clasificación o regresión, mientras que EXPLAIN ordena los atributos según su influencia en la explicación de una columna objetivo. La nueva función PROFILE de la versión 11g encuentra segmentos de clientes y sus perfiles, dado un atributo objetivo. Estas operaciones pueden utilizarse como parte de un flujo de trabajo operativo para proporcionar resultados procesables o para que los usuarios finales los interpreten.

Referencias y lecturas adicionales

  • TH Davenport, Competir mediante el análisis de datos , Harvard Business Review, enero de 2006.
  • I. Ben-Gal, Detección de valores atípicos. Archivado el 15/12/2022 en Wayback Machine . En: Maimon O. y Rockach L. (Eds.) Manual de minería de datos y descubrimiento de conocimiento: una guía completa para profesionales e investigadores, Kluwer Academic Publishers, 2005, ISBN. 0-387-24435-2.
  • MM Campos, PJ Stengard y BL Milenova, Minería de datos automatizada centrada en datos. En las actas de la Cuarta Conferencia Internacional sobre Aprendizaje Automático y Aplicaciones 2005 , 15-17 de diciembre de 2005. pp8, ISBN 0-7695-2495-8
  • MF Hornick, Erik Marcade y Sunil Venkayala. Minería de datos en Java: estrategia, estándares y práctica. Morgan-Kaufmann, 2006, ISBN 0-12-370452-9.
  • BL Milenova, JS Yarmus y MM Campos. SVM en la base de datos Oracle 10g: eliminando las barreras para la adopción generalizada de máquinas de vectores de soporte. En Actas de la 31.ª Conferencia Internacional sobre Bases de Datos Muy Grandes (Trondheim, Noruega, 30 de agosto - 2 de septiembre de 2005). pp. 1152-1163, ISBN 1-59593-154-6.
  • BL Milenova y MM Campos. O-Cluster: agrupamiento escalable de grandes conjuntos de datos de alta dimensión. En las actas de la Conferencia Internacional IEEE de Minería de Datos de 2002: ICDM 2002. pp. 290-297, ISBN 0-7695-1754-4.
  • P. Tamayo, C. Berger, MM Campos, JS Yarmus, BLMilenova, A. Mozes, M. Taft, M. Hornick, R. Krishnan, S. Thomas, M. Kelly, D. Mukhin, R. Haberstroh, S. Stephens y J. Myczkowski. Minería de datos en Oracle: Minería de datos en el entorno de la base de datos. En la Parte VII del Manual de minería de datos y descubrimiento de conocimiento , Maimon, O.; Rokach, L. (Eds.) 2005, págs. 315-1329, ISBN 0-387-24435-2.
  • Brendan Tierney, Análisis predictivo con Oracle Data Miner: para el científico de datos, analista de Oracle, desarrollador de Oracle y administrador de bases de datos, Oracle Press, McGraw Hill, primavera de 2014.

Véase también

  • Oracle LogMiner , a diferencia de la minería de datos genérica, se centra en la extracción de información de los registros internos de una base de datos Oracle.

Referencias

  1. 1 2 Patente estadounidense 7174344 , Campos, Marcos M. y Milenova, Boriana L., "Agrupamiento por particionamiento ortogonal", emitida el 6 de febrero de 2007, asignada a Oracle International Corporation 
  2. 1 2 Boriana L. Milenova y Marcos M. Campos (2002); O-Cluster: Agrupamiento escalable de grandes conjuntos de datos de alta dimensión , Actas de ICDM '02 de la Conferencia Internacional IEEE de Minería de Datos de 2002, páginas 290-297, ISBN 0-7695-1754-4.
  3. "Oracle Data Miner" . Oracle Technology Network . Oracle Corporation. 2014. Consultado el 17 de julio de 2014. Oracle Data Miner es una extensión de Oracle SQL Developer que permite a los analistas de datos trabajar directamente con los datos dentro de la base de datos, explorarlos gráficamente, crear y evaluar múltiples modelos de minería de datos, aplicar modelos de Oracle Data Mining a nuevos datos e implementar las predicciones y los conocimientos de Oracle Data Mining en toda la empresa. [...] Oracle Data Miner se compone de tres componentes: Oracle Database 12c o Oracle Database 11g Release 2, SQL Developer (cliente) que incluye la interfaz gráfica de usuario del flujo de trabajo de Oracle Data Miner, y el repositorio de Data Miner, instalado en la base de datos Oracle.
  • Oracle Data Mining en Oracle Technology Network .
  • Blog de minería de datos de Oracle .
  • Oracle Database 11g en Oracle Technology Network .
  • Blog de Oracle sobre minería de datos y análisis .
  • Wiki de Oracle para la minería de datos .
  • Canal RSS de minería de datos de Oracle .
  • Oracle Data Mining en Oracle Technology Network .
  • Blog relacionado con la minería de datos de Oracle escrito por Brendan Tierney (Director ACE de Oracle) .
  • Ejemplos de minería de datos de Oracle (en Panoply Technology) .