El proceso estándar intersectorial para la minería de datos , conocido como CRISP-DM , [ 1 ] es un modelo de proceso estándar abierto que describe los enfoques comunes utilizados por los expertos en minería de datos . Es el modelo analítico más utilizado . [ 2 ]
En 2015, IBM lanzó una nueva metodología llamada Analytics Solutions Unified Method for Data Mining/Predictive Analytics [ 3 ] [ 4 ] (también conocida como ASUM-DM ), que refina y extiende CRISP-DM.
Historia
CRISP-DM se concibió en 1996 y se convirtió en un proyecto de la Unión Europea en el marco de la iniciativa de financiación ESPRIT en 1997. El proyecto fue liderado por cinco empresas: Integral Solutions Ltd (ISL) , Teradata , Daimler AG , NCR Corporation y OHRA , una compañía de seguros.
Este consorcio principal aportó diversas experiencias al proyecto. ISL fue adquirida posteriormente e integrada en SPSS . El gigante informático NCR Corporation desarrolló el almacén de datos Teradata y su propio software de minería de datos. Daimler-Benz contaba con un importante equipo de minería de datos. La OHRA comenzaba a explorar el potencial de la minería de datos.
La primera versión de la metodología se presentó en el 4.º Taller CRISP-DM SIG en Bruselas en marzo de 1999, [ 5 ] y se publicó como una guía paso a paso de minería de datos más tarde ese mismo año. [ 6 ]
Entre 2006 y 2008, se formó un SIG de CRISP-DM 2.0 y se debatió la actualización del modelo de proceso de CRISP-DM. [ 7 ] Se desconoce el estado actual de estos esfuerzos. Sin embargo, tanto el sitio web original crisp-dm.org citado en las revisiones, [ 8 ] [ 9 ] como el sitio web del SIG de CRISP-DM 2.0 ya no están activos. [ 7 ]
Aunque muchos profesionales de minería de datos que no pertenecen a IBM utilizan CRISP-DM, [ 10 ] [ 11 ] [ 12 ] IBM es la principal corporación que actualmente utiliza el modelo de proceso CRISP-DM. Pone a disposición para su descarga algunos de los documentos antiguos de CRISP-DM y lo ha incorporado a su producto SPSS Modeler . [ 6 ]
Según las investigaciones actuales, CRISP-DM es el modelo de minería de datos más utilizado debido a sus diversas ventajas, que han resuelto problemas existentes en la industria de la minería de datos. Una de las desventajas de este modelo es que no realiza actividades de gestión de proyectos. El éxito de CRISP-DM se debe en gran medida a su independencia de la industria, las herramientas y las aplicaciones. [ 13 ] [ 14 ]
Fases principales

CRISP-DM divide el proceso de minería de datos en seis fases principales: [ 15 ]
- Comprensión empresarial
- Comprensión de datos
- Preparación de datos
- Modelado
- Evaluación
- Despliegue
La secuencia de las fases no es estricta y suele ser necesario alternar entre ellas. Las flechas en el diagrama de procesos indican las dependencias más importantes y frecuentes entre las fases. El círculo exterior simboliza la naturaleza cíclica de la minería de datos. Un proceso de minería de datos continúa incluso después de la implementación de una solución. Las lecciones aprendidas durante el proceso pueden generar nuevas preguntas de negocio, a menudo más específicas, y los procesos de minería de datos posteriores se beneficiarán de la experiencia de los anteriores.
Encuestas y marcos de procesos alternativos
Las encuestas realizadas en el mismo sitio web ( KDNuggets ) en 2002, 2004, 2007 y 2014 muestran que fue la metodología líder utilizada por los mineros de datos de la industria que decidieron responder a la encuesta. [ 10 ] [ 11 ] [ 12 ] [ 16 ] El único otro enfoque de minería de datos mencionado en estas encuestas fue SEMMA . Sin embargo, SAS Institute afirma claramente que SEMMA no es una metodología de minería de datos, sino más bien una "organización lógica del conjunto de herramientas funcionales de SAS Enterprise Miner". Una revisión y crítica de los modelos de procesos de minería de datos en 2009 llamó a CRISP-DM el "estándar de facto para desarrollar proyectos de minería de datos y descubrimiento de conocimiento". [ 17 ] Otras revisiones de CRISP-DM y modelos de procesos de minería de datos incluyen la revisión de Kurgan y Musilek de 2006, [ 8 ] y la comparación de Azevedo y Santos de 2008 de CRISP-DM y SEMMA. [ 9 ] Los esfuerzos para actualizar la metodología comenzaron en 2006, pero, a junio de 2015, no han dado como resultado una nueva versión, y el "Grupo de Interés Especial" (SIG) responsable, junto con el sitio web, desapareció hace mucho tiempo (véase Historia de CRISP-DM ).
En 2024, Harvard Business Review publicó un marco actualizado, bizML, diseñado para ser más relevante para el personal empresarial y ser específico para proyectos de aprendizaje automático en particular, en lugar de para proyectos de análisis , ciencia de datos o minería de datos en general. [ 18 ]
Referencias
- ↑ Shearer C., El modelo CRISP-DM: el nuevo plan maestro para la minería de datos , J Data Warehousing (2000); 5:13—22.
- ↑ Lo que el departamento de TI necesita saber sobre el proceso de minería de datos. Publicado por Forbes el 29 de julio de 2015 y consultado el 24 de junio de 2018.
- ↑ ¿Has visto ASUM-DM? , Por Jason Haffar, 16 de octubre de 2015, SPSS Predictive Analytics, IBM. Archivado el 8 de marzo de 2016 en Wayback Machine .
- ↑ Método unificado de soluciones analíticas: implementaciones con principios ágiles. Publicado por IBM el 1 de marzo de 2016 y consultado el 5 de octubre de 2018.
- ↑ Pete Chapman (1999); Guía del usuario de CRISP-DM .
- 1 2 Pete Chapman, Julian Clinton, Randy Kerber, Thomas Khabaza, Thomas Reinartz, Colin Shearer y Rüdiger Wirth (2000); The CRISP-DM User Guide ( entrada en semantic scholar, incluyendo enlaces a PDFs ), ( versión PDF con gráficos de alta resolución archivada el 12 de septiembre de 2020 en Wayback Machine ).
- 1 2 Colin Shearer (2006); Primer taller sobre CRISP-DM 2.0
- 1 2 Lukasz Kurgan y Petr Musilek (2006); Un estudio de los modelos de procesos de descubrimiento de conocimiento y minería de datos . The Knowledge Engineering Review. Volumen 21 Número 1, marzo de 2006, pp 1–24, Cambridge University Press, Nueva York, NY, EE. UU. doi: 10.1017/S0269888906000737.
- 1 2 Azevedo, A. y Santos, MF (2008); KDD, SEMMA y CRISP-DM: una visión general paralela . En Actas de la Conferencia Europea IADIS sobre Minería de Datos 2008, pp. 182–185.
- 1 2 Gregory Piatetsky-Shapiro (2002); Encuesta sobre la metodología de KDnuggets
- 1 2 Gregory Piatetsky-Shapiro (2004); Encuesta sobre la metodología de KDnuggets
- 1 2 Gregory Piatetsky-Shapiro (2007); Encuesta sobre la metodología de KDnuggets
- ↑ Mariscal, G., Marban, O., Fernandez, C. (2010). "Una revisión de los modelos y metodologías del proceso de minería de datos y descubrimiento de conocimiento". The Knowledge Engineering Review . 25 (2): 137– 166. doi : 10.1017/S0269888910000032 . S2CID 31359633 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Costa, CJ; Aparicio, JT (2020). POST-DS: Una metodología para impulsar la ciencia de datos . XV Conferencia Ibérica de Sistemas y Tecnologías de la Información 2020. Sevilla, España. pp. 1– 6. doi : 10.23919/CISTI49556.2020.9140932 .
- ↑ Harper, Gavin; Stephen D. Pickett (agosto de 2006). "Métodos para la minería de datos HTS" . Drug Discovery Today . 11 ( 15–16 ): 694–699 . doi : 10.1016/j.drudis.2006.06.006 . PMID 16846796 .
- ↑ Gregory Piatetsky-Shapiro (2014); Encuesta sobre metodología de KDnuggets
- ↑ Martínez-Plumed, Fernando; Contreras-Ochando, Lidia; Ferri, César; Flach, Peter; Hernández-Orallo, José; Kull, Meelis; Lachiche, Nicolás; Ramírez-Quintana, María José (19 de septiembre de 2017). "CASP-DM: proceso estándar consciente del contexto para la minería de datos". arXiv : 1709.09003 [ cs.DB ].
- ↑ Eric Siegel (2024); Cómo llevar los proyectos de aprendizaje automático de la idea a la ejecución
- Minería de datos aplicada
- Análisis de datos
- Estándares