(No confundir con el régimen de aprendizaje perezoso, véase Núcleo tangente neuronal ).
En el aprendizaje automático , el aprendizaje perezoso es un método de aprendizaje en el que la generalización de los datos de entrenamiento se retrasa, en teoría, hasta que se realiza una consulta al sistema, a diferencia del aprendizaje ansioso , donde el sistema intenta generalizar los datos de entrenamiento antes de recibir consultas. [ 1 ]
La principal motivación para emplear el aprendizaje perezoso, como en el algoritmo de los k vecinos más cercanos , utilizado por los sistemas de recomendación en línea ("las personas que vieron/compraron/escucharon esta película/artículo/canción también..."), es que el conjunto de datos se actualiza continuamente con nuevas entradas (por ejemplo, nuevos artículos a la venta en Amazon, nuevas películas para ver en Netflix, nuevos vídeos en YouTube , nueva música en Spotify o Pandora). Debido a esta actualización continua, los "datos de entrenamiento" quedarían obsoletos en un tiempo relativamente corto, especialmente en áreas como los libros y las películas, donde se publican/lanzan continuamente nuevos éxitos de ventas o películas/canciones de éxito. Por lo tanto, no se puede hablar realmente de una "fase de entrenamiento".
Los clasificadores perezosos son más útiles para conjuntos de datos grandes y en constante cambio con pocos atributos que se consultan con frecuencia. Específicamente, incluso si existe un gran conjunto de atributos (por ejemplo, los libros tienen año de publicación, autor/es, editorial, título, edición, ISBN, precio de venta, etc.), las consultas de recomendación se basan en muchos menos atributos (por ejemplo, datos de coocurrencia de compra o visualización y calificaciones de usuarios de los artículos comprados/visualizados). [ 2 ]
Ventajas
La principal ventaja de emplear un método de aprendizaje perezoso es que la función objetivo se aproximará localmente, como en el algoritmo de k-vecinos más cercanos . Debido a que la función objetivo se aproxima localmente para cada consulta al sistema, los sistemas de aprendizaje perezoso pueden resolver simultáneamente múltiples problemas y manejar con éxito los cambios en el dominio del problema. Al mismo tiempo, pueden reutilizar muchos resultados teóricos y aplicados del modelado de regresión lineal (en particular, la estadística PRESS ) y el control. [ 3 ] Se dice que la ventaja de este sistema se logra si las predicciones usando un solo conjunto de entrenamiento se desarrollan solo para unos pocos objetos. [ 4 ] Esto se puede demostrar en el caso de la técnica k-NN, que se basa en instancias y la función solo se estima localmente. [ 5 ] [ 6 ]
Desventajas
Las desventajas teóricas del aprendizaje perezoso incluyen:
- El gran espacio de almacenamiento necesario para guardar el conjunto completo de datos de entrenamiento no supone un problema en la práctica, gracias a los avances en hardware y al número relativamente pequeño de atributos (por ejemplo, la frecuencia de coocurrencia) que deben almacenarse.
- Los datos de entrenamiento particularmente ruidosos aumentan innecesariamente la base de casos, ya que no se realiza ninguna abstracción durante la fase de entrenamiento. En la práctica, como se mencionó anteriormente, el aprendizaje perezoso se aplica a situaciones en las que cualquier aprendizaje previo pronto queda obsoleto debido a cambios en los datos. Además, para los problemas en los que el aprendizaje perezoso es óptimo, los datos "ruidosos" prácticamente no existen: quien compra un libro o bien ha comprado otro, o bien no lo ha hecho.
- Los métodos de aprendizaje perezoso suelen ser más lentos de evaluar. En la práctica, para bases de datos muy grandes con alta concurrencia, las consultas no se posponen hasta el momento de la consulta real, sino que se recalculan periódicamente (por ejemplo, cada noche) anticipándose a futuras consultas, y las respuestas se almacenan. De esta forma, la próxima vez que se realicen nuevas consultas sobre las entradas existentes en la base de datos, las respuestas se consultan rápidamente en lugar de tener que calcularse sobre la marcha, lo que casi con toda seguridad colapsaría un sistema multiusuario de alta concurrencia.
- Un mayor volumen de datos de entrenamiento también implica un mayor costo. En particular, existe un costo computacional fijo, ya que un procesador solo puede procesar una cantidad limitada de puntos de datos de entrenamiento. [ 7 ]
Existen técnicas estándar para mejorar la eficiencia del recálculo, de modo que una respuesta específica no se vuelva a calcular a menos que los datos que la afectan hayan cambiado (por ejemplo, nuevos artículos, nuevas compras, nuevas visualizaciones). En otras palabras, las respuestas almacenadas se actualizan de forma incremental.
Este método, utilizado por grandes plataformas de comercio electrónico y medios de comunicación, se emplea desde hace tiempo en el portal Entrez del Centro Nacional de Información Biotecnológica (NCBI) para precalcular las similitudes entre los distintos elementos de sus extensos conjuntos de datos: secuencias biológicas, estructuras proteicas tridimensionales, resúmenes de artículos publicados, etc. Debido a la frecuencia de las consultas para encontrar elementos similares, el NCBI utiliza hardware altamente paralelo para realizar un recálculo diario. Este recálculo se realiza únicamente para las nuevas entradas de los conjuntos de datos, comparándolas entre sí y con las existentes: no es necesario recalcular la similitud entre dos entradas ya existentes.
Ejemplos de métodos de aprendizaje perezoso
- K-vecinos más cercanos , que es un caso especial de aprendizaje basado en instancias .
- Regresión local .
- Reglas bayesianas ingenuas y perezosas, ampliamente utilizadas en software comercial de detección de spam. En este caso, los spammers se vuelven cada vez más astutos y revisan sus estrategias de spam, por lo que las reglas de aprendizaje también deben actualizarse continuamente.
Referencias
- ↑ Aha, David (29 de junio de 2013). Aprendizaje perezoso ( edición ilustrada). Springer Science & Business Media, 2013. pág. 424. ISBN 978-9401720533Consultado el 30 de septiembre de 2021 .
- ↑ Tamrakar, Preeti; Roy, Siddharth Singha; Satapathy, Biswajit; Ibrahim, SP Syed (2019). Integración de la clasificación asociativa de aprendizaje perezoso con el algoritmo kNN . pp. 1–4 . doi : 10.1109/ViTECoN.2019.8899415 . ISBN 978-1-5386-9353-7.
- ↑ Bontempi, Gianluca; Birattari, Mauro; Bersini, Hugues (1 de enero de 1999). "Aprendizaje perezoso para el modelado local y el diseño de control". International Journal of Control . 72 ( 7–8 ): 643–658 . Bibcode : 1999IJC....72..643B . doi : 10.1080/002071799220830 .
- ↑ Sammut, Claude; Webb, Geoffrey I. (2011). Enciclopedia del aprendizaje automático . Nueva York: Springer Science & Business Media. pág. 572. ISBN 9780387307688.
- ↑ Pal, Saurabh (2017-11-02). Aplicaciones de minería de datos. Un estudio comparativo para predecir el rendimiento estudiantil . GRIN Verlag. ISBN 9783668561458.
- ↑ Loncarevic, Zvezdan; Simonic, Mihael; Ude, Ales; Gams, Andrej (2022). Combinación de aprendizaje por refuerzo y aprendizaje perezoso para un aprendizaje por transferencia con pocos ejemplos más rápido . pp. 285–290 . doi : 10.1109/Humanoids53995.2022.10000095 . ISBN 979-8-3503-0979-9.
- ↑ Aha, David W. (2013). Aprendizaje perezoso . Berlín: Springer Science & Business Media. pág. 106. ISBN 9789401720533.
Lecturas adicionales
- lazy: Aprendizaje perezoso para regresión local , paquete de R con manual de referencia
- "El paquete de aprendizaje para perezosos" . Archivado del original el 16 de febrero de 2012.
- Webb GI (2011) Aprendizaje perezoso. En: Sammut C., Webb GI (eds) Enciclopedia del aprendizaje automático. Springer, Boston, MA
- David W. Aha: Aprendizaje perezoso. Kluwer Academic Publishers, Norwell 1997, ISBN 0-7923-4584-3.
- Atkeson, Christopher G.; Moore, Andrew W.; Schaal, Stefan (1 de febrero de 1997). "Aprendizaje ponderado localmente para el control". Artificial Intelligence Review . 11 (1): 75– 113. doi : 10.1023/A:1006511328852 . S2CID 3694612 .
- Bontempi, Gianluca; Birattari, Mauro; Bersini, Hugues (1999). "Aprendizaje perezoso para el modelado local y el diseño de control" . International Journal of Control . 72 (7): 643– 658. Bibcode : 1999IJC....72..643B . doi : 10.1080/002071799220830 .
- Aha, David W.; Kibler, Dennis; Albert, Marc K. (1 de enero de 1991). "Algoritmos de aprendizaje basados en instancias" . Machine Learning . 6 (1): 37– 66. doi : 10.1007/BF00153759 .
- Aprendizaje automático