El aprendizaje profundo por refuerzo ( Deep RL ) es un subcampo del aprendizaje automático que combina el aprendizaje por refuerzo (RL) y el aprendizaje profundo . El RL considera el problema de un agente computacional que aprende a tomar decisiones por ensayo y error. El Deep RL incorpora el aprendizaje profundo a la solución, lo que permite a los agentes tomar decisiones a partir de datos de entrada no estructurados sin la ingeniería manual del espacio de estados . Los algoritmos de Deep RL pueden procesar entradas muy grandes (por ejemplo, cada píxel renderizado en la pantalla de un videojuego) y decidir qué acciones realizar para optimizar un objetivo (por ejemplo, maximizar la puntuación del juego). El aprendizaje profundo por refuerzo se ha utilizado para una amplia gama de aplicaciones, incluyendo, entre otras, robótica , videojuegos , procesamiento del lenguaje natural , visión artificial , [ 1 ] educación, transporte, finanzas y atención médica . [ 2 ]
Descripción general
Aprendizaje profundo

El aprendizaje profundo es una forma de aprendizaje automático que transforma un conjunto de entradas en un conjunto de salidas mediante una red neuronal artificial . Los métodos de aprendizaje profundo, que a menudo utilizan aprendizaje supervisado con conjuntos de datos etiquetados, han demostrado ser eficaces para resolver tareas que implican el manejo de datos de entrada sin procesar complejos y de alta dimensión (como imágenes) con menos ingeniería de características manual que los métodos anteriores, lo que ha permitido un progreso significativo en varios campos, incluyendo la visión por computadora y el procesamiento del lenguaje natural . En la última década, el aprendizaje por refuerzo profundo ha logrado resultados notables en una variedad de problemas, desde juegos para un solo jugador y multijugador como Go , juegos de Atari y Dota 2 hasta robótica. [ 3 ]
Aprendizaje por refuerzo

El aprendizaje por refuerzo es un proceso en el que un agente aprende a tomar decisiones mediante ensayo y error. Este problema se suele modelar matemáticamente como un proceso de decisión de Markov (MDP), donde un agente en cada paso de tiempo se encuentra en un estadotoma medidas, recibe una recompensa escalar y pasa al siguiente estadosegún la dinámica del entornoEl agente intenta aprender una política.o mapear desde observaciones a acciones, para maximizar sus retornos (suma esperada de recompensas). En el aprendizaje por refuerzo (a diferencia del control óptimo ) el algoritmo solo tiene acceso a la dinámicamediante muestreo.
aprendizaje por refuerzo profundo
En muchos problemas prácticos de toma de decisiones, los estadosLos MDP son de alta dimensión (por ejemplo, imágenes de una cámara o el flujo de datos sin procesar de un robot) y no pueden ser resueltos por algoritmos de RL tradicionales. Los algoritmos de aprendizaje por refuerzo profundo incorporan aprendizaje profundo para resolver dichos MDP, a menudo representando la políticao otras funciones aprendidas como una red neuronal y el desarrollo de algoritmos especializados que funcionen bien en este entorno.
Historia
Junto con el creciente interés en las redes neuronales a partir de mediados de la década de 1980, creció el interés en el aprendizaje profundo por refuerzo, donde se utiliza una red neuronal en el aprendizaje por refuerzo para representar políticas o funciones de valor. Debido a que en dicho sistema, todo el proceso de toma de decisiones, desde los sensores hasta los motores en un robot o agente, involucra una sola red neuronal , a veces también se le llama aprendizaje por refuerzo de extremo a extremo. [ 4 ] Una de las primeras aplicaciones exitosas del aprendizaje por refuerzo con redes neuronales fue TD-Gammon , un programa informático desarrollado en 1992 para jugar al backgammon . [ 5 ] Se utilizaron cuatro entradas para el número de piezas de un color determinado en una ubicación determinada del tablero, lo que totalizó 198 señales de entrada. Con cero conocimiento incorporado, la red aprendió a jugar el juego a un nivel intermedio mediante autoaprendizaje y TD() .
Los libros de texto fundamentales de Sutton y Barto sobre aprendizaje por refuerzo, [ 6 ] Bertsekas y Tsitiklis sobre programación neurodinámica, [ 7 ] y otros [ 8 ] impulsaron el conocimiento y el interés en el campo.
El grupo de Katsunari Shibata demostró que en este marco emergen diversas funciones, [ 9 ] [ 10 ] [ 11 ] incluyendo el reconocimiento de imágenes, la constancia del color, el movimiento del sensor (reconocimiento activo), la coordinación mano-ojo y el movimiento de alcance de la mano, la explicación de las actividades cerebrales, la transferencia de conocimiento, la memoria, [ 12 ] la atención selectiva, la predicción y la exploración. [ 10 ] [ 13 ]
A partir de 2012, la denominada revolución del aprendizaje profundo impulsó un mayor interés en el uso de redes neuronales profundas como aproximadores de funciones en diversos ámbitos. Esto generó un renovado interés entre los investigadores que utilizan redes neuronales profundas para aprender las funciones de política, valor y/o Q presentes en los algoritmos de aprendizaje por refuerzo existentes.
A partir de 2013, DeepMind mostró resultados de aprendizaje impresionantes utilizando aprendizaje por refuerzo profundo para jugar videojuegos de Atari . [ 14 ] [ 15 ] El jugador computarizado era una red neuronal entrenada con un algoritmo de aprendizaje por refuerzo profundo, una versión profunda del aprendizaje Q que denominaron redes Q profundas (DQN), con la puntuación del juego como recompensa. Utilizaron una red neuronal convolucional profunda para procesar 4 fotogramas de píxeles RGB (84x84) como entradas. Los 49 juegos se aprendieron utilizando la misma arquitectura de red y con un conocimiento previo mínimo, superando a los métodos de la competencia en casi todos los juegos y alcanzando un nivel comparable o superior al de un probador de juegos humano profesional. [ 15 ]
El aprendizaje profundo por refuerzo alcanzó otro hito en 2015 cuando AlphaGo , [ 16 ] un programa informático entrenado con RL profundo para jugar Go , se convirtió en el primer programa informático de Go en vencer a un jugador humano profesional de Go sin hándicap en un tablero completo de 19×19. En un proyecto posterior en 2017, AlphaZero mejoró el rendimiento en Go al tiempo que también demostró que podía usar el mismo algoritmo para aprender a jugar ajedrez y shogi a un nivel competitivo o superior al de los programas informáticos existentes para esos juegos, y volvió a mejorar en 2019 con MuZero . [ 17 ] Por separado, otro hito fue alcanzado por investigadores de la Universidad Carnegie Mellon en 2019 desarrollando Pluribus , un programa informático para jugar póker que fue el primero en vencer a profesionales en juegos multijugador de Texas hold 'em sin límite . OpenAI Five , un programa para jugar Dota 2 cinco contra cinco venció a los anteriores campeones mundiales en un partido de demostración en 2019.
El aprendizaje profundo por refuerzo también se ha aplicado a muchos dominios más allá de los juegos. En robótica, se ha utilizado para que los robots realicen tareas domésticas simples [ 18 ] y resuelvan un cubo de Rubik con una mano robótica. [ 19 ] [ 20 ] El RL profundo también ha encontrado aplicaciones de sostenibilidad, utilizado para reducir el consumo de energía en centros de datos. [ 21 ] El RL profundo para la conducción autónoma es un área activa de investigación en la academia y la industria. [ 22 ] Loon exploró el RL profundo para la navegación autónoma de sus globos de gran altitud. [ 23 ]
Algoritmos
Existen diversas técnicas para entrenar políticas que resuelvan tareas con algoritmos de aprendizaje por refuerzo profundo, cada una con sus propias ventajas. En el nivel más básico, se distingue entre el aprendizaje por refuerzo basado en modelos y el aprendizaje por refuerzo sin modelos, lo que se refiere a si el algoritmo intenta aprender un modelo predictivo de la dinámica del entorno.
En los algoritmos de aprendizaje profundo por refuerzo basados en modelos , se estima un modelo predictivo de la dinámica del entorno, generalmente mediante aprendizaje supervisado con una red neuronal. A continuación, se obtienen acciones mediante control predictivo basado en el modelo aprendido. Dado que la dinámica real del entorno suele diferir de la dinámica aprendida, el agente replanifica con frecuencia al realizar acciones en dicho entorno. Las acciones seleccionadas pueden optimizarse mediante métodos de Monte Carlo, como el método de entropía cruzada , o mediante una combinación de aprendizaje de modelos con métodos sin modelo.
En los algoritmos de aprendizaje por refuerzo profundo sin modelo , una políticaSe aprende sin modelar explícitamente la dinámica hacia adelante. Una política puede optimizarse para maximizar los retornos estimando directamente el gradiente de la política [ 24 ] , pero sufre de alta varianza, lo que la hace poco práctica para su uso con aproximación de funciones en RL profundo. Se han desarrollado algoritmos posteriores para un aprendizaje más estable y se han aplicado ampliamente. [ 25 ] [ 26 ] Otra clase de algoritmos de aprendizaje por refuerzo profundo sin modelo se basa en la programación dinámica , inspirada en el aprendizaje por diferencia temporal y el Q-learning . En espacios de acción discretos, estos algoritmos suelen aprender una función Q de red neuronal.que estima los rendimientos futuros tomando medidasdel estado. [ 14 ] En espacios continuos, estos algoritmos a menudo aprenden tanto una estimación de valor como una política. [ 27 ] [ 28 ] [ 29 ]
Investigación
El aprendizaje profundo por refuerzo es un área de investigación activa, con varias líneas de indagación.
Exploración
Un agente de aprendizaje por refuerzo (RL) debe equilibrar la disyuntiva exploración/explotación: el problema de decidir si seguir acciones que ya se sabe que producen altas recompensas o explorar otras acciones para descubrir recompensas mayores. Los agentes de RL suelen recopilar datos con algún tipo de política estocástica, como una distribución de Boltzmann en espacios de acción discretos o una distribución gaussiana en espacios de acción continuos, lo que induce un comportamiento de exploración básico. La idea detrás de la exploración basada en la novedad, o impulsada por la curiosidad, es darle al agente un motivo para explorar resultados desconocidos con el fin de encontrar las mejores soluciones. Esto se hace "modificando la función de pérdida (o incluso la arquitectura de la red) agregando términos para incentivar la exploración". [ 30 ] Un agente también puede recibir ayuda en la exploración utilizando demostraciones de trayectorias exitosas, o modelado de recompensas, dándole al agente recompensas intermedias que se personalizan para ajustarse a la tarea que está intentando completar. [ 31 ]
Aprendizaje por refuerzo fuera de política
Una distinción importante en el aprendizaje por refuerzo (RL) radica en la diferencia entre los algoritmos basados en políticas, que requieren evaluar o mejorar la política que recopila datos, y los algoritmos basados en políticas, que pueden aprender una política a partir de datos generados por una política arbitraria. Generalmente, los métodos basados en funciones de valor, como el aprendizaje Q, son más adecuados para el aprendizaje basado en políticas y presentan una mayor eficiencia de muestreo: la cantidad de datos necesarios para aprender una tarea se reduce gracias a la reutilización de datos para el aprendizaje. En el extremo opuesto, el RL fuera de línea (o por lotes) considera el aprendizaje de una política a partir de un conjunto de datos fijo sin interacción adicional con el entorno.
Aprendizaje por refuerzo inverso
El aprendizaje por refuerzo inverso (RL inverso) se refiere a inferir la función de recompensa de un agente a partir de su comportamiento. Este tipo de aprendizaje puede utilizarse para aprender a partir de demostraciones (o aprendizaje por imitación ) infiriendo la recompensa del demostrador y optimizando posteriormente una política para maximizar los resultados mediante RL. Se han utilizado enfoques de aprendizaje profundo para diversas formas de aprendizaje por imitación y RL inverso. [ 32 ]
Aprendizaje por refuerzo condicionado a objetivos
Otra área activa de investigación es la del aprendizaje de políticas condicionadas por objetivos, también llamadas políticas contextuales o universales.que incluyen un objetivo adicionalcomo entrada para comunicar un objetivo deseado al agente. [ 33 ] La reproducción de la experiencia retrospectiva es un método para el aprendizaje por refuerzo condicionado por objetivos que implica almacenar y aprender de intentos fallidos anteriores para completar una tarea. [ 34 ] Si bien un intento fallido puede no haber alcanzado el objetivo previsto, puede servir como lección sobre cómo lograr el resultado no deseado a través del reetiquetado retrospectivo.
Aprendizaje por refuerzo multiagente
Muchas aplicaciones del aprendizaje por refuerzo no involucran un solo agente, sino un conjunto de agentes que aprenden y se adaptan conjuntamente. Estos agentes pueden ser competitivos, como en muchos juegos, o cooperativos, como en muchos sistemas multiagente del mundo real. El aprendizaje por refuerzo multiagente estudia los problemas que surgen en este contexto.
Generalización
La promesa de usar herramientas de aprendizaje profundo en el aprendizaje por refuerzo es la generalización: la capacidad de operar correctamente en entradas no vistas previamente. Por ejemplo, las redes neuronales entrenadas para el reconocimiento de imágenes pueden reconocer que una imagen contiene un pájaro, incluso si nunca han visto esa imagen en particular ni ese pájaro en particular. Dado que el aprendizaje profundo por refuerzo permite datos sin procesar (por ejemplo, píxeles) como entrada, se reduce la necesidad de predefinir el entorno, lo que permite que el modelo se generalice a múltiples aplicaciones. Con esta capa de abstracción, los algoritmos de aprendizaje profundo por refuerzo se pueden diseñar de manera que sean generales y el mismo modelo se pueda usar para diferentes tareas. [ 35 ] Un método para aumentar la capacidad de generalización de las políticas entrenadas con políticas de aprendizaje profundo por refuerzo es incorporar el aprendizaje de representación . [ 36 ]
Aprendizaje por refuerzo profundo para la toma de decisiones financieras
Existe un creciente número de investigaciones sobre el uso del aprendizaje por refuerzo profundo (RL profundo) para problemas financieros, en particular la optimización de carteras . Los enfoques tradicionales, como la teoría moderna de carteras (MPT), se basan en la optimización de la media-varianza para equilibrar el riesgo y la rentabilidad. Sin embargo, a menudo carecen de la adaptabilidad necesaria en mercados volátiles. El RL profundo, por otro lado, reformula el problema como un proceso dinámico de toma de decisiones utilizando marcos como los procesos de decisión de Markov (MDP) o los procesos de decisión de Markov parcialmente observados (POMDP) .
Este enfoque permite que un agente de aprendizaje por refuerzo profundo interactúe continuamente con el mercado, tomando decisiones para maximizar los rendimientos a largo plazo basándose en datos en constante evolución. Los componentes esenciales de los modelos de aprendizaje por refuerzo profundo, como los espacios de estado y acción, las funciones de recompensa y las técnicas de optimización de políticas, desempeñan un papel crucial en esta adaptabilidad. Modelos como el gradiente de política determinista profundo (DDPG) y la optimización de políticas proximal (PPO) destacan por su aplicación en espacios de acción continuos y su potencial para gestionar la complejidad de los mercados financieros. [ 37 ] [ 38 ] [ 39 ]
La implementación del aprendizaje por refuerzo profundo en el ámbito de los problemas financieros sigue siendo un área de investigación en constante evolución.
Referencias
- ↑ Le, Ngan; Rathour, Vidhiwar Singh; Yamazaki, Kashu; Luu, Khoa; Savvides, Marios (2022-04-01). "Aprendizaje profundo por refuerzo en visión artificial: una revisión exhaustiva". Artificial Intelligence Review . 55 (4): 2733– 2819. arXiv : 2108.11510 . doi : 10.1007/s10462-021-10061-9 . ISSN 1573-7462 .
- ↑ Francois-Lavet, Vincent; Henderson, Peter; Islam, Riashat; Bellemare, Marc G.; Pineau, Joelle (2018). "Una introducción al aprendizaje profundo por refuerzo". Fundamentos y tendencias en aprendizaje automático . 11 ( 3–4 ): 219–354 . arXiv : 1811.12560 . Bibcode : 2018arXiv181112560F . doi : 10.1561/2200000071 . ISSN 1935-8237 . S2CID 54434537 .
- ↑ Graesser, Laura. "Fundamentos del aprendizaje profundo por refuerzo: teoría y práctica en Python" . Biblioteca Abierta de la Universidad Telkom . Consultado el 1 de julio de 2023 .
- ↑ Demis, Hassabis (11 de marzo de 2016). Inteligencia artificial y el futuro (Discurso).
- ↑ Tesauro, Gerald (marzo de 1995). "Aprendizaje por diferencia temporal y TD-Gammon" . Communications of the ACM . 38 (3): 58– 68. doi : 10.1145/203330.203343 . S2CID 8763243 .
- ↑ Sutton, Richard; Barto, Andrew (septiembre de 1996). Aprendizaje por refuerzo: una introducción . Athena Scientific.
- ↑ Bertsekas, John; Tsitsiklis, Dimitri (septiembre de 1996). Programación neurodinámica . Athena Scientific. ISBN 1-886529-10-8.
- ↑ Miller, W. Thomas; Werbos, Paul; Sutton, Richard (1990). Redes neuronales para control .
- ↑ Shibata, Katsunari; Okabe, Yoichi (1997). Aprendizaje por refuerzo cuando las señales sensoriales visuales se dan directamente como entradas (PDF) . Conferencia Internacional sobre Redes Neuronales (ICNN) 1997. Archivado del original (PDF) el 9 de diciembre de 2020. Consultado el 1 de diciembre de 2020 .
- 1 2 Shibata, Katsunari; Iida, Masaru (2003). Adquisición de empujar cajas mediante aprendizaje por refuerzo basado en visión directa (PDF) . Conferencia anual de SICE 2003. Archivado del original (PDF) el 9 de diciembre de 2020. Recuperado el 1 de diciembre de 2020 .
- ↑ Shibata, Katsunari (7 de marzo de 2017). "Funciones que emergen a través del aprendizaje por refuerzo de extremo a extremo". arXiv : 1703.02239 [ cs.AI ].
- ↑ Utsunomiya, Hiroki; Shibata, Katsunari (2008). Contextual Behavior and Internal Representations Acquired by Reinforcement Learning with a Recurrent Neural Network in a Continuous State and Action Space Task (PDF) . International Conference on Neural Information Processing (ICONIP) '08. Archivado del original (PDF) el 10 de agosto de 2017. Consultado el 14 de diciembre de 2020 .
- ↑ Shibata, Katsunari; Kawano, Tomohiko (2008). Aprendizaje de generación de acciones a partir de imágenes de cámara sin procesar en un entorno similar al mundo real mediante el acoplamiento simple de aprendizaje por refuerzo y una red neuronal (PDF) . Conferencia Internacional sobre Procesamiento de Información Neuronal (ICONIP) '08. Archivado del original (PDF) el 11 de diciembre de 2020. Recuperado el 1 de diciembre de 2020 .
- 1 2 Mnih, Volodymyr; et al. (diciembre de 2013). Jugando a Atari con aprendizaje profundo por refuerzo (PDF) . Taller de aprendizaje profundo de NIPS 2013.
- 1 2 Mnih, Volodymyr; et al. (2015). "Control a nivel humano mediante aprendizaje profundo por refuerzo". Nature . 518 (7540): 529– 533. Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . PMID 25719670 . S2CID 205242740 .
- ^ Plata, David ; Huang, Aja ; Maddison, Chris J.; Guez, Arturo; Sifré, Laurent; Driessche, George van den; Schrittwieser, Julián; Antonoglou, Ioannis; Panneershelvam, Veda; Lanctot, Marc; Dieleman, Sander; Grewe, Dominik; Nham, Juan; Kalchbrenner, Nal; Sutskever, Ilya ; Lillicrap, Timoteo; Lixiviación, Madeleine; Kavukcuoglu, Koray; Graepel, Thore; Hassabis, Demis (28 de enero de 2016). "Dominar el juego de Go con redes neuronales profundas y búsqueda de árboles". Naturaleza . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038 / nature16961 . ISSN 0028-0836 . PMID 26819042. S2CID 515925 .

- ↑ Schrittwieser, Julián; Antonoglou, Ioannis; Hubert, Thomas; Simonyan, Karen; Sifré, Laurent; Schmitt, Simón; Guez, Arturo; Lockhart, Eduardo; Hassabis, Demis; Graepel, Thore; Lillicrap, Timoteo; Plata, David (23 de diciembre de 2020). "Dominar Atari, Go, ajedrez y shogi planificando con un modelo aprendido" . Naturaleza . 588 (7839): 604– 609. arXiv : 1911.08265 . Código Bib : 2020Natur.588..604S . doi : 10.1038/s41586-020-03051-4 . PMID 33361790 . S2CID 208158225 .
- ↑ Levine, Sergey ; Finn, Chelsea ; Darrell, Trevor; Abbeel, Pieter (enero de 2016). " Entrenamiento integral de políticas visuomotoras profundas" (PDF) . JMLR . 17. arXiv : 1504.00702 .
- ↑ "OpenAI - Resolviendo el cubo de Rubik con una mano robótica" . OpenAI . 5 de enero de 2021.
- ↑ OpenAI; et al. (2019). Resolviendo el cubo de Rubik con una mano robótica . arXiv : 1910.07113 .
- ↑ "La IA de DeepMind reduce la factura de refrigeración del centro de datos de Google en un 40 %" . DeepMind . 14 de mayo de 2024.
- ↑ "Taller sobre aprendizaje automático para la conducción autónoma en NeurIPS 2021" . NeurIPS 2021. Diciembre de 2021.
- ^ Bellamare, Marc; Cándido, Salvatore; Castro, Pablo; Gong, junio; Machado, Marlos; Moitra, Subhodeep; Ponda, Samira; Wang, Ziyu (2 de diciembre de 2020). "Navegación autónoma de globos estratosféricos mediante aprendizaje por refuerzo" . Naturaleza . 588 (7836): 77– 82. Bibcode : 2020Natur.588...77B . doi : 10.1038/s41586-020-2939-8 . PMID 33268863 . S2CID 227260253 .
- ↑ Williams, Ronald J (1992). "Algoritmos estadísticos simples de seguimiento de gradiente para el aprendizaje por refuerzo conexionista" . Machine Learning . 8 ( 3–4 ): 229–256 . doi : 10.1007/BF00992696 . S2CID 2332513 .
- ↑ Schulman, John; Levine, Sergey; Moritz, Philipp; Jordan, Michael; Abbeel, Pieter (2015). Optimización de políticas de región de confianza . Conferencia internacional sobre aprendizaje automático (ICML). arXiv : 1502.05477 .
- ↑ Schulman, John; Wolski, Filip; Dhariwal, Prafulla; Radford, Alec; Klimov, Oleg (2017). Algoritmos de optimización de políticas proximales . arXiv : 1707.06347 .
- ↑ Lillicrap, Timothy; Hunt, Jonathan; Pritzel, Alexander; Heess, Nicolas; Erez, Tom; Tassa, Yuval; Silver, David; Wierstra, Daan (2016). Control continuo con aprendizaje profundo por refuerzo . Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR). arXiv : 1509.02971 .
- ↑ Mnih, Volodymyr; Puigdomenech Badia, Adria; Mirzi, Mehdi; Graves, Alex; Harley, Tim; Lillicrap, Timothy; Silver, David; Kavukcuoglu, Koray (2016). Métodos asíncronos para el aprendizaje profundo por refuerzo . Conferencia internacional sobre aprendizaje automático (ICML). arXiv : 1602.01783 .
- ↑ Haarnoja, Tuomas; Zhou, Aurick; Levine, Sergey; Abbeel, Pieter (2018). Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor . International Conference on Machine Learning (ICML). arXiv : 1801.01290 .
- ↑ Reizinger, Patrik; Szemenyei, Márton (23 de octubre de 2019). «Exploración impulsada por la curiosidad basada en la atención en el aprendizaje profundo por refuerzo». ICASSP 2020 - Conferencia Internacional IEEE de Acústica, Habla y Procesamiento de Señales (ICASSP) de 2020. pp. 3542–3546 . arXiv : 1910.10840 . doi : 10.1109/ICASSP40776.2020.9054546 . ISBN 978-1-5090-6631-5. S2CID 204852215 .
- ↑ Wiewiora, Eric (2010), "Reward Shaping", en Sammut, Claude; Webb, Geoffrey I. (eds.), Encyclopedia of Machine Learning , Boston, MA: Springer US, pp. 863–865 , doi : 10.1007/978-0-387-30164-8_731 , ISBN 978-0-387-30164-8
- ↑ Wulfmeier, Markus; Ondruska, Peter; Posner, Ingmar (2015). "Maximum Entropy Deep Inverse Reinforcement Learning". arXiv : 1507.04888 [ cs.LG ].
- ↑ Schaul, Tom; Horgan, Daniel; Gregor, Karol; Silver, David (2015). Aproximadores de funciones de valor universal . Conferencia Internacional sobre Aprendizaje Automático (ICML).
- ↑ Andrychowicz, Marcin; Wolski, Filip; Ray, Alex; Schneider, Jonas; Fong, Rachel; Welinder, Peter; McGrew, Bob; Tobin, Josh; Abbeel, Pieter; Zaremba, Wojciech (2018). Reproducción de la experiencia retrospectiva . Avances en sistemas de procesamiento de información neuronal (NeurIPS). arXiv : 1707.01495 .
- ↑ Packer, Charles; Gao, Katelyn; Kos, Jernej; Krähenbühl, Philipp; Koltun, Vladlen; Song, Dawn (2019-03-15). "Evaluación de la generalización en el aprendizaje profundo por refuerzo". arXiv : 1810.12282 [ cs.LG ].
- ^ François-Lavet, Vicente; Bengio, Yoshua; Precopa, Doina; Pineau, Joelle (2019). "Aprendizaje por refuerzo combinado mediante representaciones abstractas". Actas de la Conferencia AAAI sobre Inteligencia Artificial . vol. 33. págs. 3582–3589 .
- ^ Jiang, Yifu; Olmo, José; Atwi, Majed (1 de septiembre de 2024). "Aprendizaje por refuerzo profundo para la selección de portafolios" . Revista de finanzas globales . 62 101016.doi : 10.1016/ j.gfj.2024.101016 . ISSN 1044-0283 .
- ↑ Choudhary, Himanshu; Orra, Arishi; Sahoo, Kartik; Thakur, Manoj (26 de mayo de 2025). "Aprendizaje profundo por refuerzo ajustado al riesgo para la optimización de carteras: un enfoque de recompensa múltiple" . Revista internacional de sistemas de inteligencia computacional . 18 (1): 126. doi : 10.1007/s44196-025-00875-8 . ISSN 1875-6883 .
- ↑ Avramelou, Loukia; Nousi, Paraskevi; Passalis, Nikolaos; Tefas, Anastasios (2024-03-15). "Aprendizaje profundo por refuerzo para el comercio financiero utilizando características multimodales" . Expert Systems with Applications . 238 121849. doi : 10.1016/j.eswa.2023.121849 . ISSN 0957-4174 .
- algoritmos de aprendizaje automático
- Aprendizaje por refuerzo
- Aprendizaje profundo