Articulo de referencia

Biblioteca de análisis de datos

oneAPI Data Analytics Library (oneDAL; anteriormente Intel Data Analytics Acceleration Library o Intel DAAL) es una biblioteca de bloques de construcción algorítmicos optimizado...

oneAPI Data Analytics Library (oneDAL; anteriormente Intel Data Analytics Acceleration Library o Intel DAAL) es una biblioteca de bloques de construcción algorítmicos optimizados para las etapas de análisis de datos más comúnmente asociadas con la solución de problemas de Big Data . [4] [5] [6] [7]

La biblioteca es compatible con procesadores Intel y está disponible para los sistemas operativos Windows , Linux y macOS . [2] La biblioteca está diseñada para su uso en plataformas de datos populares, como Hadoop , Spark , R y MATLAB . [4] [8]

Historia

Intel lanzó la biblioteca de análisis de datos Intel (oneDAL) el 8 de diciembre de 2020. También lanzó la biblioteca de aceleración de análisis de datos el 25 de agosto de 2015 y la denominó biblioteca de aceleración de análisis de datos Intel 2016 (Intel DAAL 2016). [9] oneDAL se incluye con Intel oneAPI Base Toolkit como producto comercial. Hay una versión independiente disponible comercialmente o de forma gratuita, [3] [10] la única diferencia está relacionada con el soporte y el mantenimiento.

Licencia

Licencia Apache 2.0

Detalles

Categorías funcionales

Intel DAAL tiene los siguientes algoritmos: [11] [4] [12]

  • Análisis
    • Momentos de orden bajo: incluye el cálculo del mínimo, máximo, media, desviación estándar, varianza, etc. para un conjunto de datos.
    • Cuantiles: dividir las observaciones en grupos de igual tamaño definidos por órdenes de cuantiles.
    • Matriz de correlación y matriz de varianza-covarianza: herramienta básica para entender la dependencia estadística entre variables. El grado de correlación indica la tendencia de un cambio a indicar el probable cambio en otro.
    • Matriz de distancia coseno: medición de distancias por pares utilizando la distancia coseno.
    • Matriz de distancia de correlación: medición de la distancia por pares entre elementos utilizando la distancia de correlación.
    • Agrupamiento: Agrupamiento de datos en grupos sin etiquetas. Esta es una técnica típica que se utiliza en el “aprendizaje no supervisado” donde no hay un modelo establecido en el que basarse. Intel DAAL ofrece dos algoritmos para el agrupamiento: K-Means y “EM para GMM”.
    • Análisis de componentes principales (PCA): el algoritmo más popular para la reducción de dimensionalidad.
    • Minería de reglas de asociación: detección de patrones de coocurrencia. Comúnmente conocida como “minería de cestas de la compra”.
    • Transformación de datos mediante descomposición matricial: DAAL proporciona algoritmos de descomposición Cholesky, QR y SVD.
    • Detección de valores atípicos: identificación de observaciones que están anormalmente distantes de la distribución típica de otras observaciones.
  • Entrenamiento y predicción
    • Regresión
      • Regresión lineal: el método de regresión más simple. Se ajusta una ecuación lineal para modelar la relación entre las variables dependientes (cosas que se deben predecir) y las variables explicativas (cosas que se conocen).
    • Clasificación: creación de un modelo para asignar elementos a diferentes grupos etiquetados. DAAL ofrece múltiples algoritmos en esta área, incluidos el clasificador Naïve Bayes, la máquina de vectores de soporte y los clasificadores multiclase.
    • Sistemas de recomendación
    • Redes neuronales

Intel DAAL admitía tres modos de procesamiento:

  • Procesamiento por lotes: cuando todos los datos caben en la memoria, se llama a una función para procesarlos todos a la vez.
  • Procesamiento en línea (también llamado Streaming): cuando no caben todos los datos en la memoria. Intel® DAAL puede procesar fragmentos de datos individualmente y combinar todos los resultados parciales en la etapa de finalización.
  • Procesamiento distribuido: DAAL admite un modelo similar a MapReduce. Los consumidores de un clúster procesan los datos locales (etapa de mapeo) y, luego, el proceso de producción recopila y combina resultados parciales de los consumidores (etapa de reducción). Intel DAAL ofrece flexibilidad en este modo al dejar las funciones de comunicación completamente en manos del desarrollador. Los desarrolladores pueden optar por utilizar el movimiento de datos en un marco como Hadoop o Spark, o codificar explícitamente las comunicaciones, probablemente con MPI.

Referencias

  1. ^ "Notas de la versión de la biblioteca de aceleración de análisis de datos Intel®". software.intel.com .
  2. ^ abcd Biblioteca de aceleración de análisis de datos Intel® (Intel® DAAL) | Software Intel®
  3. ^ ab "Proyecto de código abierto: Biblioteca de aceleración de análisis de datos Intel (DAAL)".
  4. ^ abc "Github de DAAL". GitHub .
  5. ^ "Intel actualiza el kit de herramientas para desarrolladores con una biblioteca de aceleración de análisis de datos". 25 de agosto de 2015.
  6. ^ "Intel agrega funciones de big data a las bibliotecas matemáticas". The Register .
  7. ^ "Intel aprovecha el núcleo HPC para impulsar las herramientas de análisis". nextplatform.com . 2015-08-25.
  8. ^ "Pruebe Intel DAAL para procesar grandes volúmenes de datos". 13 de enero de 2016.
  9. ^ "Biblioteca de aceleración de análisis de datos de Intel".
  10. ^ "Licencias comunitarias de bibliotecas de rendimiento Intel".
  11. ^ Guía para desarrolladores de Intel(R) Data Analytics Acceleration Library 2020
  12. ^ "Introducción a Intel DAAL, Parte 1: Regresión polinómica con computación en modo por lotes". 28 de octubre de 2015.
Obtenido de "https://es.wikipedia.org/w/index.php?title=Biblioteca_de_análisis_de_datos&oldid=1246667348"