Articulo de referencia

Desviación conceptual

En análisis predictivo , ciencia de datos , aprendizaje automático y campos afines, la deriva conceptual o simplemente deriva es una evolución de los datos que invalida el model...

En análisis predictivo , ciencia de datos , aprendizaje automático y campos afines, la deriva conceptual o simplemente deriva es una evolución de los datos que invalida el modelo de datos . Ocurre cuando las propiedades estadísticas de la variable objetivo, que el modelo intenta predecir, cambian con el tiempo de forma imprevista. Esto genera problemas, ya que las predicciones se vuelven menos precisas con el paso del tiempo. La detección y adaptación a la deriva son de vital importancia en los campos que implican datos y modelos de datos que cambian dinámicamente.

Decaimiento del modelo predictivo

En el aprendizaje automático y el análisis predictivo, este fenómeno de deriva se denomina deriva conceptual. En el aprendizaje automático, un elemento común de un modelo de datos son las propiedades estadísticas, como la distribución de probabilidad de los datos reales. Si estas se desvían de las propiedades estadísticas del conjunto de datos de entrenamiento , las predicciones aprendidas pueden volverse inválidas si no se corrige la deriva. [ 1 ] [ 2 ] [ 3 ] [ 4 ]

Decaimiento de la configuración de datos

Otro ámbito importante es la ingeniería de software , donde se pueden identificar tres tipos de deriva de datos que afectan a la fidelidad de los mismos . Los cambios en el entorno del software ("deriva de la infraestructura") pueden invalidar la configuración de la infraestructura. La "deriva estructural" se produce cuando cambia el esquema de datos , lo que puede invalidar las bases de datos. La "deriva semántica" consiste en cambios en el significado de los datos, mientras que la estructura permanece inalterada. En muchos casos, esto puede ocurrir en aplicaciones complejas cuando numerosos desarrolladores independientes introducen cambios sin ser plenamente conscientes de las repercusiones de dichos cambios en otras áreas del sistema de software . [ 5 ] [ 6 ]

Para muchos sistemas de aplicaciones, la naturaleza de los datos sobre los que operan está sujeta a cambios por diversas razones, por ejemplo, debido a cambios en el modelo de negocio , actualizaciones del sistema o cambio de la plataforma en la que opera el sistema. [ 6 ]

En el caso de la computación en la nube , la deriva de la infraestructura que puede afectar a las aplicaciones que se ejecutan en la nube puede ser causada por las actualizaciones del software de la nube. [ 5 ]

Existen varios tipos de efectos perjudiciales de la deriva de datos en la fidelidad de los datos. La corrosión de datos es el paso de datos desviados al sistema sin ser detectados. La pérdida de datos ocurre cuando se ignoran datos válidos debido a la falta de conformidad con el esquema aplicado. El desperdicio es el fenómeno cuando se introducen nuevos campos de datos aguas arriba en la cadena de procesamiento de datos, pero en algún punto aguas abajo estos campos de datos están ausentes. [ 6 ] Las encuestas de la industria también han identificado la deriva del modelo como uno de los varios contribuyentes a los fallos de los proyectos de IA. Una encuesta de 2026 realizada por Radixweb informó que la deriva del modelo técnico representó el 6,5 % de los incidentes de fallos de IA reportados entre sus encuestados.

Datos inconsistentes

La "deriva de datos" puede referirse al fenómeno por el cual los registros de la base de datos no coinciden con los datos del mundo real debido a los cambios que estos últimos experimentan con el tiempo. Este es un problema común en las bases de datos que involucran personas, como clientes, empleados, ciudadanos, residentes, etc. La deriva de datos humanos puede deberse a cambios no registrados en datos personales, como el lugar de residencia o el nombre, así como a errores durante la introducción de datos. [ 7 ]

La "deriva de datos" también puede referirse a la inconsistencia de los elementos de datos entre varias réplicas de una base de datos. Las razones pueden ser difíciles de identificar. Una forma sencilla de detectar la deriva es ejecutar la suma de comprobación periódicamente. Sin embargo, la solución puede no ser tan sencilla. [ 8 ]

Ejemplos

El comportamiento de los clientes en una tienda online puede cambiar con el tiempo. Por ejemplo, si se pretende predecir las ventas semanales de mercancía y se ha desarrollado un modelo predictivo que funciona satisfactoriamente, este modelo puede utilizar datos como la inversión en publicidad , las promociones y otras métricas que influyen en las ventas. Es probable que la precisión del modelo disminuya con el tiempo; esto se conoce como deriva conceptual. En la aplicación de ventas de mercancía, una de las razones de la deriva conceptual puede ser la estacionalidad, es decir, que el comportamiento de compra varía según la temporada. Por ejemplo, las ventas pueden ser mayores durante las vacaciones de invierno que durante el verano. La deriva conceptual suele producirse cuando las covariables que componen el conjunto de datos empiezan a explicar con menos precisión la variación del conjunto objetivo. Pueden surgir variables de confusión que no se pueden controlar, lo que provoca que la precisión del modelo disminuya progresivamente con el tiempo. Generalmente, se recomienda realizar comprobaciones de funcionamiento como parte del análisis posterior a la producción y volver a entrenar el modelo con nuevos supuestos ante cualquier indicio de deriva conceptual.

Posibles soluciones

Para evitar el deterioro de la precisión de la predicción debido a la deriva conceptual, se pueden adoptar soluciones reactivas y de seguimiento . Las soluciones reactivas reentrenan el modelo en respuesta a un mecanismo desencadenante, como una prueba de detección de cambios [ 9 ] [ 10 ] o gráficos de control del control estadístico de procesos [ 11 ] , para detectar explícitamente la deriva conceptual como un cambio en las estadísticas del proceso generador de datos. Cuando se detecta la deriva conceptual, el modelo actual ya no está actualizado y debe reemplazarse por uno nuevo para restaurar la precisión de la predicción [ 12 ] [ 13 ]. Una desventaja de los enfoques reactivos es que el rendimiento puede decaer hasta que se detecta el cambio. Las soluciones de seguimiento buscan rastrear los cambios en el concepto actualizando continuamente el modelo. Los métodos para lograr esto incluyen el aprendizaje automático en línea , el reentrenamiento frecuente en las muestras observadas más recientemente [ 14 ] y el mantenimiento de un conjunto de clasificadores donde un nuevo clasificador se entrena en el lote de ejemplos más reciente y reemplaza al clasificador más antiguo del conjunto [ 15 ] .

La información contextual, cuando está disponible, puede utilizarse para explicar mejor las causas de la desviación conceptual: por ejemplo, en la aplicación de predicción de ventas, la desviación conceptual podría compensarse añadiendo información sobre la temporada al modelo. Al proporcionar información sobre la época del año, es probable que la tasa de deterioro del modelo disminuya, pero es improbable que la desviación conceptual se elimine por completo. Esto se debe a que el comportamiento de compra real no sigue ningún modelo estático y finito . Pueden surgir nuevos factores en cualquier momento que influyan en el comportamiento de compra, y la influencia de los factores conocidos o sus interacciones pueden cambiar.

La deriva conceptual es inevitable en fenómenos complejos que no se rigen por leyes naturales fijas . Todos los procesos derivados de la actividad humana, como los socioeconómicos y los biológicos , son propensos a experimentarla. Por lo tanto, es necesario un reentrenamiento periódico, también conocido como actualización, de cualquier modelo.

Métodos de remedio

  • DDM (Método de Detección de Deriva): detecta la deriva monitorizando la tasa de error del modelo a lo largo del tiempo. Cuando la tasa de error supera un umbral preestablecido, entra en una fase de advertencia, y si supera otro umbral, entra en una fase de deriva.
  • EDDM (Método de Detección Temprana de Deriva): mejora la tasa de detección de DDM al rastrear la distancia promedio entre dos errores en lugar de solo la tasa de error.
  • ADWIN (Adaptive Windowing): almacena dinámicamente una ventana de datos recientes y advierte al usuario si detecta un cambio significativo entre las estadísticas de los datos anteriores de la ventana en comparación con los datos más recientes.
  • KSWIN (ventana de Kolmogorov-Smirnov): detecta la deriva basándose en la prueba estadística de Kolmogorov-Smirnov . [ 16 ]

DDM y EDDM: Detección de deriva conceptual

  • Métodos supervisados ​​en línea que se basan en la monitorización secuencial de errores para estimar la tasa de error en evolución.

ADWIN y KSWIN: Ventanas

  • Mantiene una "ventana", un subconjunto de los datos más recientes del flujo de datos, que comprueba para detectar diferencias estadísticas a lo largo de la ventana. [ 16 ]

Aplicaciones en seguridad

La deriva conceptual es un problema recurrente en el análisis de seguridad, especialmente en la detección de malware e intrusiones. En estos sistemas, los modelos suelen entrenarse con registros, binarios o rastros de red anteriores, pero el comportamiento de los atacantes cambia con el tiempo a medida que aparecen nuevas familias de malware, técnicas de ofuscación y campañas. Cuando los datos ya no se asemejan al conjunto de entrenamiento, los límites de decisión aprendidos por los clasificadores o detectores de anomalías pueden desalinearse con el panorama de amenazas actual y el rendimiento de la detección puede disminuir a menos que los modelos se actualicen o reemplacen. [ 16 ] [ 17 ]

Varios estudios sobre la detección de modelos de malware de Windows como un flujo de datos en evolución y el seguimiento de cómo cambia el rendimiento con el paso del tiempo. [ 16 ] Demuestran que los clasificadores entrenados en una ventana de tiempo fija pueden funcionar bien con datos recientes, pero se deterioran rápidamente cuando se evalúan con muestras recopiladas meses o años después, incluso cuando se dispone de grandes cantidades de datos de entrenamiento. [ 16 ] Para mantenerse al día con esto, los sistemas de seguridad suelen utilizar ventanas deslizantes o adaptativas, que restringen el entrenamiento a la porción más reciente de los datos, de modo que los ejemplos más antiguos y menos relevantes se descartan gradualmente. También emplean detectores de deriva como ADWIN y KSWIN que monitorizan las tasas de error o los cambios en la distribución de las observaciones recientes y señalan cuando las estadísticas del flujo entrante difieren significativamente del pasado, lo que provoca un reentrenamiento o la sustitución del modelo. [ 16 ] [ 18 ]

Problemas similares aparecen en el filtrado de spam, la detección de fraude y la detección de intrusiones, donde los atacantes modifican el contenido, los patrones de actividad o el comportamiento de la red para evadir los modelos entrenados con datos históricos. En estos casos, la desviación puede ser gradual, a medida que surgen nuevos tipos de spam o fraude, o abrupta, tras un cambio repentino en las técnicas de ataque. Las estrategias comunes para mantener la eficacia incluyen actualizar los modelos con ejemplos etiquetados recientes, utilizar conjuntos que den mayor peso a los clasificadores entrenados con datos más recientes y diseñar características menos sensibles a cambios superficiales en la forma en que se llevan a cabo los ataques. [ 19 ]

La investigación sobre el aprendizaje automático para la seguridad también ha demostrado que no manejar correctamente la deriva conceptual durante la evaluación puede generar muchos sesgos. Los investigadores estudiaron 30 sistemas de seguridad basados ​​en aprendizaje y descubrieron que muchos detectores solo se probaron en períodos cortos de tiempo o solo en laboratorio. Esto ignora las correlaciones temporales, la no estacionariedad y la forma en que los ataques cambian en el mundo real, lo que puede hacer que estos sistemas parezcan mucho más efectivos de lo que realmente son cuando se ponen en uso [ 20 ] . Los autores señalan formas en que las personas pueden espiar el tiempo, como usar características de muestras de malware más recientes al entrenar modelos que se supone que funcionan con datos más antiguos, calcular estadísticas de normalización o incrustaciones en todo el conjunto de datos. También hablan sobre el uso de conjuntos de datos de referencia antiguos que no entrenan modelos para las amenazas actuales [ 20 ] . Los investigadores sugieren usar protocolos de evaluación conscientes del tiempo que mantengan el orden causal, no permitan que la información futura se filtre en el entrenamiento y se aseguren de que los datos de seguridad tengan en cuenta tanto el tiempo como el espacio para que el rendimiento informado muestre mejor los efectos de la deriva conceptual en situaciones del mundo real. [ 20 ]

Deriva conceptual, evolución conceptual y manipulación adversaria

La deriva conceptual se refiere a cuando la relación entre las características de entrada y sus etiquetas correspondientes cambia gradualmente con el tiempo. Consideremos un ejemplo sencillo: los correos electrónicos de phishing . Los ataques más antiguos aprovechaban señales prominentes, como la presencia de la palabra "lotería", mientras que las variantes más recientes introducían frases más elaboradas, como "lotería y no estafa", en un intento de parecer más legítimos y evadir la detección. Esto es una forma de deriva conceptual porque la clase subyacente —phishing— permanece igual, pero los patrones de características que la definen cambian a medida que los atacantes se adaptan. Sin embargo, es importante distinguir la deriva conceptual de su desafío relacionado, pero inherentemente diferente: la evolución conceptual. La "evolución conceptual" ocurre cuando surge una familia de ataques completamente nueva con patrones de características que el modelo nunca ha encontrado. El modelo se expone a nuevas características y patrones que no estaban presentes en los datos de entrenamiento. En el entorno multiclase, significa que se introduce una etiqueta completamente nueva. Para el entorno binario (benigno vs. malicioso), se introduce una familia maliciosa completamente nueva; sin embargo, el modelo sigue intentando hacer predicciones basadas en patrones de características obsoletos. Un ejemplo de esto sería si un modelo se entrena con características de troyanos y ransomware , pero luego surge malware de minería de criptomonedas. Esto sigue siendo "malicioso" en términos de etiquetado; sin embargo, significa que las características ahora son nuevas para el modelo. La deriva conceptual y la evolución conceptual ponen de manifiesto la rapidez con la que los atacantes se adaptan y siguen evolucionando sus técnicas para explotar las debilidades en los modelos de ciberdefensa. Los atacantes actualizan regularmente sus cargas útiles, metodologías de comunicación e incluso las API de las que dependen. Esto se traduce en que un modelo que solo se entrena con datos históricos queda obsoleto a menos que se actualice o se diseñe para aprender continuamente. [ 21 ]

Estos cambios de comportamiento no siempre ocurren de forma orgánica; los atacantes pueden introducirlos intencionalmente. Las principales causas de la deriva conceptual son los ataques adversarios, ya que cambios leves y cuidadosamente elaborados en el malware por parte del atacante afectarán la relación entrada-etiqueta, lo que lleva a que los modelos clasifiquen erróneamente el malware como benigno. Los ataques adversarios generalmente se dividen en dos tipos: de caja blanca y de caja negra. En los ataques de caja blanca, el atacante tiene acceso completo al modelo, incluyendo su arquitectura, parámetros y gradientes. Un ejemplo de ataque de caja blanca serían aquellos en los que el atacante utiliza enfoques basados ​​en gradientes para generar pequeñas perturbaciones en una muestra, provocando su clasificación errónea. En el otro extremo se encuentran los ataques de caja negra. El adversario conoce la entrada y la salida del modelo, pero no su funcionamiento interno. Los atacantes pueden sondear las salidas del modelo —a veces enviando miles de entradas ligeramente diferentes— hasta que algo escape al detector, o bien entrenan un modelo sustituto y luego generan ejemplos adversarios que se transfieren al sistema original. Estas tácticas modifican gradualmente los patrones que observa el modelo, acelerando la deriva y reduciendo considerablemente la eficacia de las defensas que antes eran fiables. [ 22 ]

Estas manipulaciones impulsadas por atacantes no solo provocan una deriva conceptual, sino que también revelan las debilidades de las técnicas de aprendizaje modernas, como el aprendizaje por transferencia . El aprendizaje por transferencia permite a los defensores tomar un modelo existente, preentrenado para alguna otra tarea, y ajustarlo en lugar de entrenarlo desde cero. Esto ha aumentado considerablemente el éxito en diversos dominios, como la clasificación de imágenes y el procesamiento del lenguaje natural . Para la detección de malware, por ejemplo, Microsoft e Intel demostraron recientemente que convertir los binarios de malware en imágenes en escala de grises permite la detección de malware utilizando modelos de visión preentrenados, lo que produce un rendimiento sólido; por ejemplo, un 87 % de recuperación con solo un 0,1 % de falsos positivos. Si bien este enfoque reduce drásticamente el tiempo de entrenamiento y el costo computacional, naturalmente conlleva una desventaja importante: la arquitectura del modelo base suele ser de dominio público. Un adversario puede aprovechar este hecho y crear ejemplos adversarios diseñados para explotar las debilidades conocidas del modelo subyacente, lo que luego permite que esas manipulaciones se "transfieran" al detector de malware recién entrenado. En este sentido, el aprendizaje por transferencia ofrece las ventajas significativas de aprovechar trabajos previos, pero también conlleva el riesgo de heredar vulnerabilidades que los atacantes pueden explotar fácilmente. [ 23 ]

Además de los ataques que evolucionan rápidamente, las defensas basadas en ML se enfrentan al conocido problema de adquirir datos o etiquetas precisas. Los agregadores de etiquetas pueden tener dificultades para etiquetar nuevas muestras, y estas etiquetas pueden ser incorrectas inicialmente. Con el tiempo, las etiquetas suelen estabilizarse hacia su valor real . Este proceso puede durar desde días hasta años. Esto se considera un factor que contribuye a la deriva conceptual, ya que durante este tiempo las etiquetas originales pueden actualizarse, pueden surgir nuevos ataques o pueden aparecer nuevas clases. Este fenómeno se denomina etiquetas retardadas y contribuye a las causas más amplias de la deriva conceptual. Por lo tanto, las etiquetas retardadas suelen tenerse en cuenta al diseñar soluciones de defensa y evaluarlas. Para detectar la deriva entre las etiquetas y las asignaciones de muestras, se suelen utilizar detectores de deriva durante la evaluación. [ 24 ]

Véase también

Lecturas adicionales

Se han publicado numerosos artículos que describen algoritmos para la detección de la deriva conceptual. Aquí solo se incluyen revisiones, estudios y resúmenes:

Reseñas

  • Souza, VMA; Reis, DM; Maletzke, AG; Batista, GEAPA (2020). "Desafíos en la evaluación comparativa de algoritmos de aprendizaje de flujo con datos del mundo real" . Minería de datos y descubrimiento de conocimiento . 34 (6): 1805– 58. arXiv : 2005.00113 . doi : 10.1007/s10618-020-00698-5 . S2CID 218470010 . 
  • Krawczyk, B.; Minku, LL; Gama, J.; Stefanowski, J.; Wozniak, M. (2017). "Aprendizaje conjunto para el análisis de flujo de datos: una encuesta" . Fusión de información . 37 : 132–156 . doi : 10.1016/j.inffus.2017.02.004 . hdl : 2381/39321 . S2CID 1372281 . 
  • Dal Pozzolo, A.; Boracchi, G.; Caelen, O.; Alippi, C.; Bontempi, G. (2015). "Detección de fraude con tarjetas de crédito y adaptación a la deriva conceptual con información supervisada retardada" (PDF) . Conferencia Internacional Conjunta sobre Redes Neuronales (IJCNN) de 2015. IEEE. pp. 1–8 . doi : 10.1109/IJCNN.2015.7280527 . ISBN  978-1-4799-1960-4. S2CID 3947699 . 
  • Alippi, C. (2014). «Aprendizaje en entornos no estacionarios y en evolución» . Inteligencia para sistemas embebidos . Springer. pp. 211–247 . doi : 10.1007/978-3-319-05278-6_9 . ISBN  978-3-319-05278-6.
  • Gama, J.; Žliobaitė, I.; Bifet, A.; Pechenizkiy, M.; Bouchachia, A. (1 de marzo de 2014), "Un estudio sobre la adaptación a la deriva conceptual" (PDF) , ACM Computing Surveys , 46 (4): 1–37 , doi : 10.1145/2523813 , ISSN 0360-0300 , Zbl 1305.68141 , Wikidata Q58204632   
  • Alippi, C.; Polikar, R. (enero de 2014). "Editorial invitada Aprendizaje en entornos no estacionarios y en evolución" . IEEE Transactions on Neural Networks and Learning Systems . 25 (1): 9– 11. doi : 10.1109/TNNLS.2013.2283547 . PMID 24806640. S2CID 16547472 .  
  • Dal Pozzolo, A.; Caelen, O.; Le Borgne, YA; Waterschoot, S.; Bontempi, G. (2014). "Lecciones aprendidas en la detección de fraude con tarjetas de crédito desde la perspectiva de un profesional" (PDF) . Expert Systems with Applications . 41 (10): 4915–28 . doi : 10.1016/j.eswa.2014.02.026 . S2CID 12656644 . 
  • Jiang, J. (2008). "Una revisión bibliográfica sobre la adaptación de dominio de clasificadores estadísticos" (PDF) . Escuela de Informática y Sistemas de Información, Universidad de Gestión de Singapur.
  • Kuncheva, LI (2008). "Conjuntos de clasificadores para la detección de cambios conceptuales en datos en tiempo real: descripción general y perspectivas" (PDF) . Actas del 2.º Taller SUEMA 2008 (ECAI 2008) .
  • Gaber, MM; Zaslavsky, A.; Krishnaswamy, S. (junio de 2005). "Minería de flujos de datos: una revisión" (PDF) . ACM SIGMOD Record . 34 (2): 18– 26. doi : 10.1145/1083784.1083789 . S2CID 705946 . 
  • Kuncheva, LI (2004). "Conjuntos de clasificadores para entornos cambiantes" (PDF) . Sistemas de clasificadores múltiples. MCS 2004. Lecture Notes in Computer Science. Vol.  3077. Springer. pp. 1–15 . doi : 10.1007/978-3-540-25966-4_1 . ISBN  978-3-540-25966-4.
  • Tsymbal, A. (2004). El problema de la deriva conceptual: definiciones y trabajos relacionados (PDF) (Informe técnico). Dublín, Irlanda: Departamento de Informática, Trinity College. TCD-CS-2004-15.
  • Ceschin, Fabricio; Botacin, Marcus; Gómez, Heitor Murilo; Pinagé, Felipe; Oliveira, Luis S.; Gregio, André (2023). "Rápido y Furioso: sobre el modelado de la detección de malware como un flujo de datos en evolución" . Sistemas expertos con aplicaciones . 212 118590.doi : 10.1016/ j.eswa.2022.118590 . ISSN 0957-4174 . 

Software

  • Frouros : Una biblioteca de Python de código abierto para la detección de deriva en sistemas de aprendizaje automático . [ 25 ]
  • NannyML : Una biblioteca de Python de código abierto para detectar desviaciones en la distribución univariada y multivariada , y para estimar el rendimiento de los modelos de aprendizaje automático sin etiquetas de referencia.
  • RapidMiner (anteriormente Yet Another Learning Environment , YALE): software libre de código abierto para el descubrimiento de conocimiento, la minería de datos y el aprendizaje automático. También incluye minería de flujos de datos, aprendizaje de conceptos variables en el tiempo y seguimiento de conceptos cambiantes. Se utiliza en combinación con su complemento de minería de flujos de datos (anteriormente complemento de detección de cambios conceptuales).
  • EDDM ( Método de detección temprana de deriva ): implementación gratuita de código abierto de métodos de detección de deriva en Weka .
  • MOA (Análisis Masivo en Línea) : software libre de código abierto específico para la minería de flujos de datos con deriva conceptual. Contiene un método de evaluación presecuencial, los métodos de deriva conceptual EDDM, un lector de conjuntos de datos reales ARFF y generadores de flujos artificiales como conceptos SEA, STAGGER, hiperplano rotatorio , árbol aleatorio y funciones basadas en radio aleatorio. MOA admite la interacción bidireccional con Weka .

conjuntos de datos

Real

  • Repositorio de flujos de datos de la USP , 27 conjuntos de datos de flujos del mundo real con deriva conceptual recopilados por Souza et al. (2020). Acceso
  • Aerolínea , aproximadamente 116 millones de registros de llegadas y salidas de vuelos (depurados y ordenados) recopilados por E. Ikonomovska. Referencia: Concurso Data Expo 2009. Acceso
  • Conjuntos de datos de Chess.com (juegos en línea) y Luxemburgo (encuesta social) recopilados por I. Zliobaite. Acceso
  • ECUE spam 2: cada conjunto de datos consta de más de 10.000 correos electrónicos recopilados durante un período de aproximadamente 2 años por una persona. Acceso desde la página web de SJDelany.
  • Elec2 , demanda de electricidad, 2 clases, 45.312 instancias. Referencia: M. Harries, Evaluación comparativa de Splice-2: Precios de la electricidad, Informe técnico, Universidad del Sur de Gales, 1999. Acceso desde la página web de J.Gama. Comentario sobre la aplicabilidad .
  • Los datos de la competición PAKDD'09 representan la tarea de evaluación crediticia. Se recopilaron durante un período de cinco años. Desafortunadamente, las etiquetas reales solo se publican para la primera parte de los datos. Acceso
  • Los conjuntos de datos de flujo de sensores y de flujo de suministro de energía están disponibles en el repositorio de minería de datos de flujo de X. Zhu. Acceso
  • SMEAR es un flujo de datos de referencia con muchos valores faltantes. Datos de observación ambiental durante 7 años. Predicción de nubosidad. Acceso
  • Minería de texto , una colección de conjuntos de datos de minería de texto con deriva conceptual, mantenida por I. Katakis. Acceso
  • Conjunto de datos de deriva de matriz de sensores de gas , una colección de 13.910 mediciones de 16 sensores químicos utilizados para la compensación de deriva en una tarea de discriminación de 6 gases en varios niveles de concentración. Acceso

Otro

  • Los datos de la competición KDD'99 contienen intrusiones simuladas en un entorno de red militar. Se utilizan a menudo como referencia para evaluar la deriva conceptual en el manejo de intrusiones. Acceso

Sintético

  • Prueba comparativa de latencia de verificación extrema Souza, VMA; Silva, DF; Gama, J.; Batista, GEAPA (2015). "Clasificación de flujos de datos guiada por agrupamiento en entornos no estacionarios y latencia de verificación extrema" . Actas de la Conferencia Internacional SIAM de 2015 sobre Minería de Datos (SDM) . SIAM. págs. 873–881 . doi : 10.1137/1.9781611974010.98 . ISBN  978-1-61197-401-0. S2CID 19198944 . Acceso desde entornos no estacionarios – Archivo.
  • Conjuntos de datos de seno, línea, plano, círculo y booleano Minku, LL; White, AP; Yao, X. (2010). "El impacto de la diversidad en el aprendizaje de conjuntos en línea en presencia de deriva conceptual" (PDF) . IEEE Transactions on Knowledge and Data Engineering . 22 (5): 730– 742. Bibcode : 2010ITKDE..22..730M . doi : 10.1109/TKDE.2009.156 . S2CID 16592739 . Acceso desde la página web de L.Minku.
  • Conceptos SEA Street, NW; Kim, Y. (2001). "Un algoritmo de conjunto en tiempo real (SEA) para la clasificación a gran escala" (PDF) . KDD'01: Actas de la séptima conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos . págs. 377–382 . doi : 10.1145/502512.502568 . ISBN  978-1-58113-391-2. S2CID 11868540 . Acceso desde la página web de J.Gama.
  • STAGGER Schlimmer, JC; Granger, RH (1986). "Aprendizaje incremental a partir de datos ruidosos" . Mach. Learn . 1 (3): 317– 354. doi : 10.1007/BF00116895 . S2CID 33776987 . 
  • Mixed Gama, J.; Medas, P.; Castillo, G.; Rodrigues, P. (2004). "Aprendizaje con detección de deriva" . Simposio brasileño sobre inteligencia artificial . Springer. pp. 286–295 . doi : 10.1007/978-3-540-28645-5_29 . ISBN  978-3-540-28645-5. S2CID 2606652 . 

marcos de generación de datos

  • Minku, White & Yao 2010 Descargar desde la página web de L.Minku.
  • Lindstrom, P.; Delany, SJ; MacNamee, B. (2008). "Piloto automático: simulación de conceptos cambiantes en datos reales" (PDF) . Actas de la 19.ª Conferencia Irlandesa sobre Inteligencia Artificial y Ciencias Cognitivas . págs. 272–263 . 
  • Narasimhamurthy, A.; Kuncheva, LI (2007). "Un marco para generar datos que simulen entornos cambiantes" . AIAP'07: Actas de la 25.ª Multiconferencia Internacional IASTED: inteligencia artificial y aplicaciones . págs. 384–389 . Código

Proyectos

  • INFER : Plataforma de inteligencia computacional para sistemas predictivos robustos y en evolución (2010-2014), Universidad de Bournemouth (Reino Unido), Evonik Industries (Alemania), Centro de Investigación e Ingeniería (Polonia)
  • HaCDAIS : Gestión de la deriva conceptual en sistemas de información adaptativos (2008-2012), Universidad Tecnológica de Eindhoven (Países Bajos)
  • KDUS : Descubrimiento de conocimiento a partir de flujos ubicuos, INESC Porto y Laboratorio de Inteligencia Artificial y Apoyo a la Toma de Decisiones (Portugal)
  • ADEPT : Técnicas de predicción de conjuntos dinámicos adaptativos, Universidad de Manchester (Reino Unido), Universidad de Bristol (Reino Unido)
  • ALADDIN : agentes de aprendizaje autónomo para redes descentralizadas de datos e información (2005–2010)
  • GAENARI : Algoritmo de árbol de decisión incremental en C++. Minimiza el daño causado por la deriva conceptual. (2022)

Puntos de referencia

  • NAB : Numenta Anomaly Benchmark, un conjunto de pruebas para evaluar algoritmos de detección de anomalías en aplicaciones de transmisión de datos en tiempo real. (2014–2018)

Reuniones

  • 2014
    • [ ] Sesión especial sobre "Desviación conceptual, adaptación de dominio y aprendizaje en entornos dinámicos" en IEEE IJCNN 2014
  • 2013
    • Taller y debate sobre los retos del mundo real de RealStream en la minería de flujos de datos, celebrado en el congreso ECML PKDD 2013 en Praga, República Checa.
    • LEAPS 2013 Primer Taller Internacional sobre Estrategias de Aprendizaje y Procesamiento de Datos en Entornos No Estacionarios
  • 2011
    • Sesión especial de LEE 2011 sobre el aprendizaje en entornos cambiantes y su aplicación a problemas del mundo real en ICMLA'11.
    • HaCDAIS 2011: Segundo taller internacional sobre cómo gestionar la deriva conceptual en sistemas de información adaptativos.
    • Programa de ICAIS 2011 sobre aprendizaje incremental
    • Sesión especial de IJCNN 2011 sobre la deriva conceptual y el aprendizaje en entornos dinámicos.
    • Simposio CIDUE 2011 sobre Inteligencia Computacional en Entornos Dinámicos e Inciertos
  • 2010
    • Taller internacional HaCDAIS 2010 sobre el manejo de la deriva conceptual en sistemas de información adaptativos: importancia, desafíos y soluciones.
    • Sesión especial de ICMLA10 sobre aprendizaje dinámico en entornos no estacionarios
    • Pista sobre flujos de datos de SAC 2010 en el Simposio ACM sobre Computación Aplicada
    • Taller internacional SensorKDD 2010 sobre descubrimiento de conocimiento a partir de datos de sensores.
    • StreamKDD 2010: Nuevas técnicas de minería de patrones en flujos de datos
    • Deriva conceptual y aprendizaje en entornos no estacionarios en el Congreso Mundial de Inteligencia Computacional del IEEE.
    • Sesión especial de MLMDS'2010 sobre métodos de aprendizaje automático para flujos de datos en la 10.ª Conferencia Internacional sobre Diseño Inteligente y Aplicaciones, ISDA'10.

Referencias

  1. Koggalahewa, Darshika; Xu, Yue; Foo, Ernest (2021). "Un enfoque jerárquico basado en pruebas con detección de desviaciones para combatir el spam en redes sociales en línea". Minería de datos . Comunicaciones en informática y ciencias de la información. Vol. 1504. pp. 47–61 . doi : 10.1007/978-981-16-8531-6_4 . hdl : 10072/412784 . ISBN   978-981-16-8530-9. S2CID 245009299 . 
  2. Widmer, Gerhard; Kubat, Miroslav (1996). "Aprendizaje en presencia de deriva conceptual y contextos ocultos" . Machine Learning . 23 (1): 69– 101. Bibcode : 1996MLear..23...69W . doi : 10.1007/BF00116900 . S2CID 206767784 . 
  3. Xia, Yuan; Zhao, Yunlong (2020). "Un método de detección de deriva basado en la medida de diversidad y la desigualdad de McDiarmid en flujos de datos". Green, Pervasive, and Cloud Computing . Lecture Notes in Computer Science. Vol. 12398. pp. 115–122 . doi : 10.1007/978-3-030-64243-3_9 . ISBN   978-3-030-64242-6. S2CID 227275380 . 
  4. Lu, Jie; Liu, Anjin; Dong, Fan; Gu, Feng; Gama, Joao; Zhang, Guangquan (2018). "Aprendizaje bajo deriva conceptual: una revisión". IEEE Transactions on Knowledge and Data Engineering : 1. arXiv : 2004.05785 . doi : 10.1109/TKDE.2018.2876857 . S2CID 69449458 . 
  5. 1 2 "¡Driftctl y Terraform son tal para cual!"
  6. 1 2 3 Girish Pancha, El flagelo oculto del Big Data: la deriva de datos , CMSWire , 8 de abril de 2016
  7. Matthew Magne, "La deriva de datos ocurre: 7 problemas molestos con los datos de personas" , InformationWeek , 19 de julio de 2017
  8. ^ Daniel Nichter, Rendimiento eficiente de MySQL , 2021, ISBN 1098105060pág . 299
  9. Basseville, Michele (1993). Detección de cambios abruptos: teoría y aplicación . Prentice Hall. ISBN 0-13-126780-9. OCLC 876004326 . 
  10. Alippi, C.; Roveri, M. (2007). "Clasificadores adaptativos en condiciones estacionarias". Conferencia Internacional Conjunta sobre Redes Neuronales de 2007. IEEE. págs. 1008–13 . doi : 10.1109/ijcnn.2007.4371096 . ISBN  978-1-4244-1380-5. S2CID 16255206 . 
  11. Malinovskaya, Anna; Mozharovskyi, Pavlo; Otto, Philipp (enero de 2024). "Monitoreo estadístico de procesos de redes neuronales artificiales" . Technometrics . 66 (1): 104– 117. doi : 10.1080/00401706.2023.2239886 .
  12. ^ Gama, J.; Medas, P.; Castillo, G.; Rodrigues, P. (2004). "Aprendizaje con detección de deriva". Avances en Inteligencia Artificial – SBIA 2004 . Saltador. págs. 286–295 . doi : 10.1007/978-3-540-28645-5_29 . ISBN  978-3-540-28645-5. S2CID 2606652 . 
  13. Alippi, C.; Boracchi, G.; Roveri, M. (2011). "Un sistema de clasificación adaptativo justo a tiempo basado en la regla de intersección de intervalos de confianza". Redes neuronales . 24 (8): 791– 800. doi : 10.1016/j.neunet.2011.05.012 . PMID 21723706 . 
  14. Widmer, G.; Kubat, M. (1996). "Aprendizaje en presencia de deriva conceptual y contextos ocultos" . Machine Learning . 23 (1): 69– 101. Bibcode : 1996MLear..23...69W . doi : 10.1007/bf00116900 . S2CID 206767784 . 
  15. Elwell, R.; Polikar, R. (2011). "Aprendizaje incremental de la deriva conceptual en entornos no estacionarios". IEEE Transactions on Neural Networks . 22 (10): 1517– 31. Bibcode : 2011ITNN...22.1517E . doi : 10.1109/tnn.2011.2160459 . PMID 21824845. S2CID 9136731 .  
  16. 1 2 3 4 5 6 Ceschin, Fabricio; Botacin, Marcus; Gómez, Heitor Murilo; Pinagé, Felipe; Oliveira, Luis S.; Gregio, André (2023). "Rápido y Furioso: sobre el modelado de la detección de malware como un flujo de datos en evolución" . Sistemas expertos con aplicaciones . 212 118590.doi : 10.1016/ j.eswa.2022.118590 . ISSN 0957-4174 . 
  17. Souza, VMA; Reis, DM; Maletzke, AG; Batista, GEAPA (2020). "Desafíos en la evaluación comparativa de algoritmos de aprendizaje de flujo con datos del mundo real". Minería de datos y descubrimiento de conocimiento . 34 (6): 1805– 1858. arXiv : 2005.00113 . doi : 10.1007/s10618-020-00698-5 . S2CID 218470010 . 
  18. Lu, Jie; Liu, Anjin; Dong, Fan; Gu, Feng; Gama, Joao; Zhang, Guangquan (2018). "Aprendizaje bajo deriva conceptual: una revisión". IEEE Transactions on Knowledge and Data Engineering : 1. arXiv : 2004.05785 . doi : 10.1109/TKDE.2018.2876857 . S2CID 69449458 . 
  19. Krawczyk, B.; Minku, LL; Gama, J.; Stefanowski, J.; Wozniak, M. (2017). "Aprendizaje de conjuntos para el análisis de flujos de datos: una revisión" . Information Fusion . 37 : 132–156 . doi : 10.1016/j.inffus.2017.02.004 . S2CID 1372281 . 
  20. 1 2 3 Arp, Daniel; Preguntando, Erwin; Pendlebury, Feargus; Warnecke, Alejandro; Pierazzi, Fabio; Wressnegger, cristiano; Cavallaro, Lorenzo; Rieck, Konrad (30 de noviembre de 2021), Lo que se debe y no se debe hacer en el aprendizaje automático en seguridad informática , arXiv : 2010.09470
  21. Fabricio Ceschin; Marco Botacin; Alberto Bifet; Bernhard Pfahringer; Luiz S. Oliveira; Heitor Murilo Gomes; André Gregio (2024). "Aprendizaje automático (en) seguridad: una corriente de problemas". Amenazas digitales: investigación y práctica . 5 : 1– 32. arXiv : 2010.16045 . doi : 10.1145/3617897 .
  22. Fabricio Ceschin; Marco Botacin; Alberto Bifet; Bernhard Pfahringer; Luiz S. Oliveira; Heitor Murilo Gomes; André Gregio (2024). "Aprendizaje automático (en) seguridad: una corriente de problemas". Amenazas digitales: investigación y práctica . 5 : 1– 32. arXiv : 2010.16045 . doi : 10.1145/3617897 .
  23. Fabricio Ceschin; Marco Botacin; Alberto Bifet; Bernhard Pfahringer; Luiz S. Oliveira; Heitor Murilo Gomes; André Gregio (2024). "Aprendizaje automático (en) seguridad: una corriente de problemas". Amenazas digitales: investigación y práctica . 5 : 1– 32. arXiv : 2010.16045 . doi : 10.1145/3617897 .
  24. Fabricio Ceschin; Marco Botacin; Alberto Bifet; Bernhard Pfahringer; Luiz S. Oliveira; Heitor Murilo Gomes; André Gregio (2024). "Aprendizaje automático (en) seguridad: una corriente de problemas". Amenazas digitales: investigación y práctica . 5 : 1– 32. arXiv : 2010.16045 . doi : 10.1145/3617897 .
  25. Céspedes Sisniega, Jaime; López García, Álvaro (2024). "Frouros: una biblioteca Python de código abierto para la detección de derivas en sistemas de aprendizaje automático" (PDF) . SoftwareX . 26 101733. Elsevier. Código Bib : 2024SoftX..2601733C . doi : 10.1016/j.softx.2024.101733 . hdl : 10261/358367 .