El aprendizaje automático automatizado ( AutoML ) es el proceso de automatizar las tareas de aplicación del aprendizaje automático a problemas del mundo real. Es la combinación de automatización y ML. [ 1 ]
AutoML potencialmente incluye todas las etapas, desde el inicio con un conjunto de datos sin procesar hasta la creación de un modelo de aprendizaje automático listo para su implementación. AutoML se propuso como una solución basada en inteligencia artificial para el creciente desafío de aplicar el aprendizaje automático. [ 2 ] [ 3 ] El alto grado de automatización en AutoML tiene como objetivo permitir que personas sin experiencia utilicen modelos y técnicas de aprendizaje automático sin necesidad de convertirse en expertos en el tema. Automatizar el proceso de aplicación del aprendizaje automático de principio a fin ofrece además las ventajas de producir soluciones más simples, una creación más rápida de dichas soluciones y modelos que a menudo superan a los modelos diseñados manualmente. [ 4 ]
Entre las técnicas comunes utilizadas en AutoML se incluyen la optimización de hiperparámetros , el metaaprendizaje y la búsqueda de arquitectura neuronal .
Comparación con el enfoque estándar
En una aplicación típica de aprendizaje automático, los profesionales disponen de un conjunto de datos de entrada para el entrenamiento. Es posible que estos datos brutos no estén en un formato compatible con todos los algoritmos. Para que los datos sean aptos para el aprendizaje automático, un experto deberá aplicar métodos adecuados de preprocesamiento , ingeniería de características , extracción de características y selección de características . Tras estos pasos, los profesionales deben seleccionar el algoritmo y optimizar los hiperparámetros para maximizar el rendimiento predictivo del modelo. Si se utiliza aprendizaje profundo, la arquitectura de la red neuronal también debe ser elegida manualmente por el experto en aprendizaje automático.
Cada uno de estos pasos puede resultar complejo, lo que supone importantes obstáculos para el uso del aprendizaje automático. AutoML busca simplificar estos pasos para quienes no son expertos y facilitarles el uso correcto y eficaz de las técnicas de aprendizaje automático.
AutoML juega un papel importante dentro del enfoque más amplio de automatización de la ciencia de datos , que también incluye tareas desafiantes como la ingeniería de datos, la exploración de datos y la interpretación y predicción de modelos. [ 5 ]
Objetivos de la automatización
El aprendizaje automático automatizado puede dirigirse a varias etapas del proceso de aprendizaje automático. [ 3 ] Los pasos para automatizar son:
- Preparación e ingesta de datos (a partir de datos brutos y formatos diversos)
- Detección del tipo de columna ; por ejemplo, booleano, numérico discreto, numérico continuo o texto.
- Detección de la intención de la columna; por ejemplo, objetivo/etiqueta, campo de estratificación , característica numérica, característica de texto categórico o característica de texto libre.
- Detección de tareas; por ejemplo, clasificación binaria , regresión , agrupamiento o clasificación.
- Ingeniería de características
- Selección de características
- Extracción de características
- Metaaprendizaje y aprendizaje por transferencia
- Detección y manejo de datos sesgados y/o valores faltantes
- Selección de modelos : elegir qué algoritmo de aprendizaje automático utilizar, lo que a menudo implica múltiples implementaciones de software competidoras.
- Combinación de modelos : una forma de consenso donde el uso de múltiples modelos a menudo da mejores resultados que cualquier modelo individual [ 6 ].
- Optimización de hiperparámetros del algoritmo de aprendizaje y extracción de características.
- Selección de pipelines bajo restricciones de tiempo, memoria y complejidad.
- Selección de métricas de evaluación y procedimientos de validación
- Verificación de problemas
- Detección de fugas
- Detección de configuración incorrecta
- Análisis de los resultados obtenidos
- Creación de interfaces de usuario y visualizaciones
Desafíos y limitaciones
Existen varios desafíos clave que se abordan en torno al aprendizaje automático automatizado. Un problema importante en este campo se conoce como "desarrollo como una industria artesanal". [ 7 ] Esta frase alude al problema del aprendizaje automático donde el desarrollo depende de decisiones manuales y sesgos de expertos. Esto contrasta con el objetivo del aprendizaje automático, que es crear sistemas que puedan aprender y mejorar a partir de su propio uso y análisis de datos. Básicamente, se trata de la lucha entre el grado de participación de los expertos en el aprendizaje de los sistemas y la libertad que se les debe otorgar a las máquinas. Sin embargo, los expertos y desarrolladores deben ayudar a crear y guiar estas máquinas para prepararlas para su propio aprendizaje. Para crear este sistema, se requiere un trabajo intensivo con conocimientos de algoritmos de aprendizaje automático y diseño de sistemas . [ 8 ]
Además, otros desafíos incluyen el metaaprendizaje [ 9 ] y la asignación de recursos computacionales.
Véase también
Referencias
- ↑ Spears, Taylor; Bondo Hansen, Kristian (18 de diciembre de 2023), "El uso y las promesas del aprendizaje automático en los mercados financieros" , The Oxford Handbook of the Sociology of Machine Learning , Oxford University Press, doi : 10.1093/oxfordhb/9780197653609.013.6 , ISBN 978-0-19-765360-9, consultado el 10 de junio de 2024
- ↑ Thornton C, Hutter F, Hoos HH, Leyton-Brown K (2013). Auto-WEKA: Selección combinada y optimización de hiperparámetros de algoritmos de clasificación . Actas de KDD '13 de la 19.ª conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos. págs. 847–855 .
- 1 2 Hutter F, Caruana R, Bardenet R, Bilenko M, Guyon I, Kegl B y Larochelle H. "AutoML 2014 @ ICML" . Taller AutoML 2014 @ ICML . Consultado el 28 de marzo de 2018 .
- ↑ Olson, RS, Urbanowicz, RJ, Andrews, PC, Lavender, NA, Kidd, LC, Moore, JH (2016). Automatización de la ciencia de datos biomédicos mediante la optimización de pipelines basada en árboles. En: Squillero, G., Burelli, P. (eds) Aplicaciones de la computación evolutiva. EvoApplications 2016. Lecture Notes in Computer Science(), vol. 9597. Springer, Cham. doi : 10.1007/978-3-319-31204-0_9
- ↑ De Bie, Tijl; De Raedt, Luc; Hernández-Orallo, José; Hoos, Holger H.; Smyth, padhraico; Williams, Christopher KI (marzo de 2022). "Automatización de la ciencia de datos" . Comunicaciones de la ACM . 65 (3): 76– 87. doi : 10.1145/3495256 . hdl : 10251/199907 .
- ↑ Erickson, Nick; Mueller, Jonas; Shirkov, Alexander; Zhang, Hang; Larroy, Pedro; Li, Mu; Smola, Alexander (2020-03-13). "AutoGluon-Tabular: AutoML robusto y preciso para datos estructurados". arXiv : 2003.06505 [ stat.ML ].
- ↑ Hutter, Frank; Kotthoff, Lars; Vanschoren, Joaquin, eds. (2019). Aprendizaje automático automatizado: métodos, sistemas, desafíos . Serie Springer sobre desafíos en el aprendizaje automático. Springer Nature. doi : 10.1007/978-3-030-05318-5 . hdl : 20.500.12657/23012 . ISBN 978-3-030-05317-8.
- ↑ Glover, Ellen (2018). "Aprendizaje automático con Python: Agrupamiento" . Built in . doi : 10.4135/9781526466426 .
- ↑ "Desafíos del metaaprendizaje" . metalearning.chalearn.org . Consultado el 3 de diciembre de 2023 .
Lecturas adicionales
- "Herramientas de código abierto para AutoML: AutoGluon, TransmogrifAI, Auto-sklearn y NNI" . Bizety . 16 de junio de 2020.
- Ferreira, Luís, et al. "A comparison of AutoML tools for machine learning, deep learning and XGBoost." 2021 International Joint Conference on Neural Networks (IJCNN). IEEE, 2021. https://repositorium.sdum.uminho.pt/bitstream/1822/74125/1/automl_ijcnn.pdf
- Feurer, M., Klein, A., Eggensperger, K., Springenberg, J., Blum, M., & Hutter, F. (2015). Efficient and robust automated machine learning. Advances in neural information processing systems, 28. https://proceedings.neurips.cc/paper_files/paper/2015/file/11d0e6287202fced83f79975ec59a3a6-Paper.pdf
- Machine learning
- Artificial intelligence
- Computational neuroscience