Articulo de referencia

Aprendizaje Q

El aprendizaje Q es un algoritmo de aprendizaje por refuerzo que entrena a un agente para asignar valores a sus posibles acciones en función de su estado actual , sin necesidad ...

El aprendizaje Q es un algoritmo de aprendizaje por refuerzo que entrena a un agente para asignar valores a sus posibles acciones en función de su estado actual , sin necesidad de un modelo del entorno ( sin modelo ). Puede manejar problemas con transiciones y recompensas estocásticas sin necesidad de adaptaciones. [ 1 ]

Por ejemplo, en un laberinto de cuadrícula, un agente aprende a llegar a una salida que vale 10 puntos. En una bifurcación, el aprendizaje Q podría asignar un valor mayor al movimiento hacia la derecha que hacia la izquierda si el movimiento hacia la derecha permite llegar a la salida más rápido, mejorando esta elección al probar ambas direcciones con el tiempo.

Para cualquier proceso de decisión de Markov finito , el aprendizaje Q encuentra una política óptima en el sentido de maximizar el valor esperado de la recompensa total en todos y cada uno de los pasos sucesivos, partiendo del estado actual. [ 2 ] El aprendizaje Q puede identificar una política óptima de selección de acciones para cualquier proceso de decisión de Markov finito dado, con un tiempo de exploración infinito y una política parcialmente aleatoria. [ 2 ]

"Q" se refiere a la función que calcula el algoritmo: la recompensa esperada —es decir, la calidad— de una acción tomada en un estado dado. [ 3 ]

Aprendizaje por refuerzo

El aprendizaje por refuerzo implica un agente y un conjunto de estados.S{\displaystyle {\mathcal {S}}}y un conjuntoA{\displaystyle {\mathcal {A}}}de acciones por estado. Al realizar una acciónaA{\displaystyle a\in {\mathcal {A}}}El agente transita de un estado a otro. Al ejecutar una acción en un estado específico, el agente recibe una recompensa (una puntuación numérica).

El objetivo del agente es maximizar su recompensa total. Para ello, suma la recompensa máxima que puede obtener en estados futuros a la recompensa por alcanzar su estado actual, influyendo así en la acción actual mediante la recompensa potencial futura. Esta recompensa potencial es una suma ponderada de los valores esperados de las recompensas de todos los pasos futuros que parten del estado actual. [ 1 ]

Como ejemplo, consideremos el proceso de abordar un tren, donde la recompensa se mide por el negativo del tiempo total empleado en el abordaje (o, dicho de otro modo, el costo de abordar el tren es igual al tiempo de abordaje). Una estrategia consiste en entrar por la puerta del tren tan pronto como se abre, minimizando así el tiempo de espera inicial. Sin embargo, si el tren está lleno, el acceso será lento tras entrar por la puerta, ya que la gente intentará salir del tren mientras usted intenta abordar. El tiempo total de abordaje, o costo, es entonces:

  • 0 segundos de tiempo de espera + 15 segundos de tiempo de combate

Al día siguiente, por casualidad (exploración), decides esperar y dejar que otros pasajeros salgan primero. Esto inicialmente resulta en un tiempo de espera más largo. Sin embargo, se dedica menos tiempo a lidiar con los pasajeros que salen. En general, este camino tiene una recompensa mayor que el del día anterior, ya que el tiempo total de embarque ahora es:

  • 5 segundos de tiempo de espera + 0 segundos de tiempo de combate

Mediante la exploración, a pesar de que la acción inicial (paciente) resulta en un costo mayor (o recompensa negativa) que en la estrategia enérgica, el costo general es menor, lo que revela una estrategia más gratificante.

Algoritmo

Una tabla de aprendizaje Q que relaciona estados con acciones, inicialmente llena de ceros y actualizada iterativamente a través del entrenamiento.

DespuésΔt{\displaystyle \Delta t}pasos hacia el futuro el agente decidirá algún paso siguiente. El peso para este paso se calcula comoγΔt{\displaystyle \gamma ^{\Delta t}}, dóndeγ{\displaystyle \gamma }(el factor de descuento ) es un número entre 0 y 1 (0γ1{\displaystyle 0\leq \gamma \leq 1}). Suponiendoγ<1{\displaystyle \gamma <1}, tiene el efecto de valorar más las recompensas recibidas antes que las recibidas después (lo que refleja el valor de un "buen comienzo").γ{\displaystyle \gamma }También puede interpretarse como la probabilidad de tener éxito (o sobrevivir) en cada paso.Δt{\displaystyle \Delta t}.

Por lo tanto, el algoritmo tiene una función que calcula la calidad de una combinación estado-acción:

Q:S×AR{\displaystyle Q:{\mathcal {S}}\times {\mathcal {A}}\to \mathbb {R} }.

Antes de que comience el aprendizaje ,Q{\displaystyle Q}Se inicializa con un valor fijo posiblemente arbitrario (elegido por el programador). Luego, en cada momentot{\displaystyle t}El agente selecciona una acción.At{\displaystyle A_{t}}observa una recompensaRt+1{\displaystyle R_{t+1}}, entra en un nuevo estadoSt+1{\displaystyle S_{t+1}}(eso puede depender del estado anterior)St{\displaystyle S_{t}}y la acción seleccionada), yQ{\displaystyle Q}se actualiza. El núcleo del algoritmo es una ecuación de Bellman como una simple actualización de iteración de valor , utilizando el promedio ponderado del valor actual y la nueva información: [ 4 ]

Qnortemiw(St,At)(1αtasa de aprendizaje)Q(St,At)valor actual+αtasa de aprendizaje(Rt+1premio+γfactor de descuentomáximoaQ(St+1,a)estimación del valor futuro óptimonuevo valor (objetivo de diferencia temporal)){\displaystyle Q^{new}(S_{t},A_{t})\leftarrow (1-\underbrace {\alpha } _{\text{tasa de aprendizaje}})\cdot \underbrace {Q(S_{t},A_{t})} _{\text{valor actual}}+\underbrace {\alpha } _{\text{tasa de aprendizaje}}\cdot {\bigg (}\underbrace {\underbrace {R_{t+1}} _{\text{recompensa}}+\underbrace {\gamma } _{\text{factor de descuento}}\cdot \underbrace {\max _{a}Q(S_{t+1},a)} _{\text{estimación del valor futuro óptimo}}} _{\text{nuevo valor (objetivo de diferencia temporal)}}{\bigg )}}

dóndeRt+1{\displaystyle R_{t+1}}es la recompensa recibida al mudarse del estadoSt{\displaystyle S_{t}}al estadoSt+1{\displaystyle S_{t+1}}, yα{\displaystyle \alpha }es la tasa de aprendizaje(0<α1){\displaystyle (0<\alpha \leq 1)}.

Tenga en cuenta queQnortemiw(St,At){\displaystyle Q^{new}(S_{t},A_{t})}es la suma de tres términos:

  • (1α)Q(St,At){\displaystyle (1-\alpha )Q(S_{t},A_{t})}: el valor actual (ponderado por uno menos la tasa de aprendizaje)
  • αRt+1{\displaystyle \alpha \,R_{t+1}}: la recompensaRt+1{\displaystyle R_{t+1}}para obtener si la acciónAt{\displaystyle A_{t}}se toma cuando está en estadoSt{\displaystyle S_{t}}(ponderado por tasa de aprendizaje)
  • αγmáximoaQ(St+1,a){\displaystyle \alpha \gamma \max _{a}Q(S_{t+1},a)}: la recompensa máxima que se puede obtener del estadoSt+1{\displaystyle S_{t+1}}(ponderado por tasa de aprendizaje y factor de descuento)

Un episodio del algoritmo termina cuando el estadoSt+1{\displaystyle S_{t+1}}es un estado final o terminal . Sin embargo, el aprendizaje Q también puede aprender en tareas no episódicas (como resultado de la propiedad de las series infinitas convergentes). Si el factor de descuento es menor que 1, los valores de acción son finitos incluso si el problema puede contener bucles o caminos infinitos.

Para todos los estados finalessF{\displaystyle s_{f}},Q(sF,a){\displaystyle Q(s_{f},a)}nunca se actualiza, sino que se establece al valor de recompensa.r{\displaystyle r}observado para el estadosF{\displaystyle s_{f}}En la mayoría de los casos,Q(sF,a){\displaystyle Q(s_{f},a)}puede tomarse igual a cero.

Influencia de las variables

Tasa de aprendizaje

La tasa de aprendizaje o tamaño del paso determina en qué medida la información recién adquirida reemplaza la información antigua. Un factor de 0 hace que el agente no aprenda nada (explotando exclusivamente el conocimiento previo), mientras que un factor de 1 hace que el agente considere solo la información más reciente (ignorando el conocimiento previo para explorar posibilidades). En entornos totalmente deterministas , una tasa de aprendizaje deαt=1{\displaystyle \alpha _{t}=1}es óptimo. Cuando el problema es estocástico , el algoritmo converge bajo ciertas condiciones técnicas en la tasa de aprendizaje que requieren que disminuya a cero. En la práctica, a menudo se utiliza una tasa de aprendizaje constante, comoαt=0.1{\displaystyle \alpha _{t}=0.1}a pesar det{\displaystyle t}. [ 5 ]

factor de descuento

El factor de descuentoγ{\displaystyle \gamma }determina la importancia de las recompensas futuras. Un factor de 0 hará que el agente sea "miope" (o cortoplacista) al considerar únicamente las recompensas actuales, es decirrt{\displaystyle r_{t}}(en la regla de actualización anterior), mientras que un factor cercano a 1 hará que se esfuerce por obtener una recompensa alta a largo plazo. Si el factor de descuento alcanza o supera 1, los valores de acción pueden divergir. Paraγ=1{\displaystyle \gamma =1} , sin un estado terminal, o si el agente nunca llega a uno, todos los historiales del entorno se vuelven infinitamente largos, y las utilidades con recompensas aditivas y sin descuento generalmente se vuelven infinitas. [ 6 ] Incluso con un factor de descuento solo ligeramente inferior a 1, el aprendizaje de la función Q conduce a la propagación de errores e inestabilidades cuando la función de valor se aproxima con una red neuronal artificial . [ 7 ] En ese caso, comenzar con un factor de descuento más bajo y aumentarlo hacia su valor final acelera el aprendizaje. [ 8 ]

Condiciones iniciales ( Q 0 )

Dado que Q -learning es un algoritmo iterativo, asume implícitamente una condición inicial antes de que ocurra la primera actualización. Los valores iniciales altos, también conocidos como "condiciones iniciales optimistas" [ 9 ] , pueden fomentar la exploración: independientemente de la acción que se seleccione, la regla de actualización hará que tenga valores más bajos que la otra alternativa, aumentando así su probabilidad de elección. La primera recompensar{\displaystyle r}puede utilizarse para restablecer las condiciones iniciales. [ 10 ] Según esta idea, la primera vez que se realiza una acción, la recompensa se utiliza para establecer el valor deQ{\displaystyle Q}Esto permite un aprendizaje inmediato en caso de recompensas deterministas fijas. Se espera que un modelo que incorpora el reinicio de las condiciones iniciales (RIC) prediga mejor el comportamiento de los participantes que un modelo que asume cualquier condición inicial arbitraria (AIC). [ 10 ] El RIC parece ser consistente con el comportamiento humano en experimentos repetidos de elección binaria. [ 10 ]

Implementación

El aprendizaje Q, en su forma más simple, almacena los datos en tablas. Este enfoque falla a medida que aumenta el número de estados/acciones, ya que la probabilidad de que el agente visite un estado determinado y realice una acción específica es cada vez menor.

Aproximación de funciones

El aprendizaje Q se puede combinar con la aproximación de funciones . [ 11 ] Esto permite aplicar el algoritmo a problemas más grandes, incluso cuando el espacio de estados es continuo.

Una solución consiste en utilizar una red neuronal artificial (adaptada) como aproximador de funciones. [ 12 ] Otra posibilidad es integrar la interpolación de reglas difusas (FRI) y utilizar bases de reglas difusas dispersas [ 13 ] en lugar de tablas Q discretas o redes neuronales artificiales, lo que tiene la ventaja de ser una forma de representación del conocimiento legible para humanos. La aproximación de funciones puede acelerar el aprendizaje en problemas finitos, debido a que el algoritmo puede generalizar experiencias previas a estados no vistos anteriormente.

Cuantización

Otra técnica para reducir el espacio de estados/acciones cuantifica los valores posibles. Consideremos el ejemplo de aprender a equilibrar un palo sobre un dedo. Para describir un estado en un momento dado, se requiere la posición del dedo en el espacio, su velocidad, el ángulo del palo y la velocidad angular del mismo. Esto da como resultado un vector de cuatro elementos que describe un estado, es decir, una instantánea de un estado codificada en cuatro valores. El problema es que existen infinitos estados posibles. Para reducir el espacio de acciones válidas, se pueden asignar múltiples valores a un contenedor. No se conoce la distancia exacta del dedo desde su posición inicial (de -infinito a infinito), sino si está lejos o no (cerca, lejos). [ 14 ]

Historia

El aprendizaje Q fue introducido por Chris Watkins en 1989. [ 15 ] Watkins y Peter Dayan presentaron una prueba de convergencia en 1992, [ 16 ] basándose en la tesis doctoral de Watkins, Learning from Delayed Rewards . Ocho años antes, en 1981, el mismo problema, bajo el nombre de "Aprendizaje por refuerzo retardado", fue resuelto por el Crossbar Adaptive Array (CAA) de Bozinovski. [ 17 ] [ 18 ] La matriz de memoriaW=w(a,s){\displaystyle W=\|w(a,s)\|}Era lo mismo que la tabla Q del aprendizaje Q, ocho años después. La arquitectura introdujo el término "evaluación de estado" en el aprendizaje por refuerzo. El algoritmo de aprendizaje de barra transversal, escrito en pseudocódigo matemático en el artículo, realiza en cada iteración el siguiente cálculo:

  • En el estado s realizar la acción a ;
  • Recibir estado de consecuencia s' ;
  • Calcular la evaluación del estadov(s){\displaystyle v(s')};
  • Actualizar el valor de la barra transversalw(a,s)=w(a,s)+v(s){\displaystyle w'(a,s)=w(a,s)+v(s')}.

El término "refuerzo secundario" se toma prestado de la teoría del aprendizaje animal , para modelar los valores de estado a través de la retropropagación : el valor de estado v(s){\displaystyle v(s')}La situación de consecuencia se retropropaga a las situaciones encontradas previamente. CAA calcula los valores de estado verticalmente y las acciones horizontalmente (la "barra transversal"). Los gráficos de demostración que muestran el aprendizaje por refuerzo retardado contenían estados (estados deseables, indeseables y neutros), que fueron calculados por la función de evaluación de estado. Este sistema de aprendizaje fue un precursor del algoritmo Q-learning. [ 19 ]

En 2014, Google DeepMind patentó [ 20 ] una aplicación de Q-learning al aprendizaje profundo , denominada "aprendizaje de refuerzo profundo" o "Q-learning profundo", que puede jugar a juegos de Atari 2600 a niveles humanos expertos.

Variantes

Aprendizaje Q profundo

El sistema DeepMind empleó una red neuronal convolucional profunda , con capas de filtros convolucionales en mosaico para imitar los efectos de los campos receptivos. El aprendizaje por refuerzo es inestable o divergente cuando se utiliza un aproximador de funciones no lineales, como una red neuronal, para representar Q. Esta inestabilidad proviene de las correlaciones presentes en la secuencia de observaciones, del hecho de que pequeñas actualizaciones de Q pueden cambiar significativamente la política del agente y la distribución de datos, y de las correlaciones entre Q y los valores objetivo. El método puede utilizarse para la búsqueda estocástica en diversos dominios y aplicaciones. [ 1 ] [ 21 ]

La técnica empleada es la repetición de experiencias, un mecanismo de inspiración biológica que utiliza una muestra aleatoria de acciones previas en lugar de la más reciente para proceder. [ 3 ] Esto elimina las correlaciones en la secuencia de observación y suaviza los cambios en la distribución de datos. Las actualizaciones iterativas ajustan Q hacia valores objetivo que se actualizan solo periódicamente, reduciendo aún más las correlaciones con el objetivo. [ 22 ]

Aprendizaje Q doble

Debido a que el valor máximo de acción aproximado futuro en Q-learning se evalúa utilizando la misma función Q que en la política de selección de acciones actual, en entornos ruidosos Q-learning a veces puede sobreestimar los valores de acción, lo que ralentiza el aprendizaje. Se propuso una variante llamada Double Q-learning para corregir esto. Double Q-learning [ 23 ] es un algoritmo de aprendizaje por refuerzo fuera de política , donde se utiliza una política diferente para la evaluación de valores que la que se utiliza para seleccionar la siguiente acción.

En la práctica, dos funciones de valor separadas QA{\displaystyle Q^{A}}yQB{\displaystyle Q^{B}}Se entrenan de forma mutuamente simétrica utilizando experiencias separadas. El paso de actualización del aprendizaje Q doble es el siguiente:

Qt+1A(st,at)=QtA(st,at)+αt(st,at)(rt+γQtB(st+1,argramo metroaincógnitaaQtA(st+1,a))QtA(st,at)){\displaystyle Q_{t+1}^{A}(s_{t},a_{t})=Q_{t}^{A}(s_{t},a_{t})+\alpha _{t}(s_{t},a_{t})\left(r_{t}+\gamma Q_{t}^{B}\left(s_{t+1},\mathop {\operatorname {arg~max} } _{a}Q_{t}^{A}(s_{t+1},a)\right)-Q_{t}^{A}(s_{t},a_{t})\right)}, y
Qt+1B(st,at)=QtB(st,at)+αt(st,at)(rt+γQtA(st+1,argramo metroaincógnitaaQtB(st+1,a))QtB(st,at)).{\displaystyle Q_{t+1}^{B}(s_{t},a_{t})=Q_{t}^{B}(s_{t},a_{t})+\alpha _{t}(s_{t},a_{t})\left(r_{t}+\gamma Q_{t}^{A}\left(s_{t+1},\mathop {\operatorname {arg~max} } _{a}Q_{t}^{B}(s_{t+1},a)\right)-Q_{t}^{B}(s_{t},a_{t})\right).}

Ahora, el valor estimado del futuro descontado se evalúa utilizando una política diferente, lo que resuelve el problema de la sobreestimación.

Este algoritmo fue modificado posteriormente en 2015 y combinado con aprendizaje profundo , [ 24 ] como en el algoritmo DQN, dando como resultado Double DQN, que supera al algoritmo DQN original. [ 25 ]

Otros

El Q-learning retardado es una implementación alternativa del algoritmo Q -learning en línea, con aprendizaje probablemente aproximadamente correcto (PAC) . [ 26 ]

Greedy GQ es una variante de Q -learning que se utiliza en combinación con la aproximación de funciones (lineales). [ 27 ] La ventaja de Greedy GQ es que la convergencia está garantizada incluso cuando se utiliza la aproximación de funciones para estimar los valores de acción.

El aprendizaje Q distribucional es una variante del aprendizaje Q que busca modelar la distribución de los rendimientos en lugar del rendimiento esperado de cada acción. Se ha observado que facilita la estimación mediante redes neuronales profundas y puede permitir métodos de control alternativos, como el control sensible al riesgo. [ 28 ]

Aprendizaje multiagente

El aprendizaje Q se ha propuesto en el entorno multiagente (véase la Sección 4.1.2 en [ 29 ] ). Un enfoque consiste en simular que el entorno es pasivo. [ 30 ] Littman propone el algoritmo de aprendizaje Q minimax. [ 31 ]

Limitaciones

El algoritmo estándar de Q-learning (que utiliza unQ{\displaystyle Q}La tabla) se aplica únicamente a espacios de acción y estado discretos. La discretización de estos valores conduce a un aprendizaje ineficiente, debido principalmente a la maldición de la dimensionalidad . Sin embargo, existen adaptaciones del Q-learning que intentan resolver este problema, como el Q-learning con redes neuronales arqueadas. [ 32 ]

Véase también

Referencias

  1. 1 2 3 Li, Shengbo (2023). Aprendizaje por refuerzo para la toma de decisiones secuenciales y el control óptimo (Primera  ed.). Springer Verlag, Singapur. pp. 1–460 . doi : 10.1007/978-981-19-7784-8 . ISBN  978-9-811-97783-1. S2CID 257928563 . {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  2. 1 2 Melo, Francisco S. "Convergencia del aprendizaje Q: una prueba simple" (PDF) . Archivado del original (PDF) el 18-11-2017 . Recuperado el 08-08-2017 .
  3. 1 2 Matiisen, Tambet (19 de diciembre de 2015). "Desmitificando el aprendizaje profundo por refuerzo" . neuro.cs.ut.ee . Laboratorio de Neurociencia Computacional. Archivado del original el 7 de abril de 2018. Recuperado el 6 de abril de 2018 .
  4. Dietterich, Thomas G. (21 de mayo de 1999). "Aprendizaje por refuerzo jerárquico con la descomposición de la función de valor MAXQ". arXiv : cs/9905014 .
  5. Sutton, Richard; Barto, Andrew (1998). Aprendizaje por refuerzo: una introducción . MIT Press.
  6. Russell, Stuart J.; Norvig , Peter (2010). Inteligencia artificial: un enfoque moderno (Tercera ed.). Prentice Hall . pág . 649. ISBN   978-0136042594.
  7. Baird, Leemon (1995). "Algoritmos residuales: aprendizaje por refuerzo con aproximación de funciones" (PDF) . ICML : 30–37 .
  8. François-Lavet, Vincent; Fonteneau, Raphael; Ernst, Damien (2015-12-07). "Cómo descontar el aprendizaje profundo por refuerzo: hacia nuevas estrategias dinámicas". arXiv : 1512.02011 [ cs.LG ].
  9. Sutton, Richard S.; Barto, Andrew G. "2.7 Valores iniciales optimistas" . Aprendizaje por refuerzo: una introducción . Archivado del original el 8 de septiembre de 2013. Recuperado el 18 de julio de 2013 .
  10. 1 2 3 Shteingart, Hanan; Neiman, Tal; Loewenstein, Yonatan (mayo de 2013). "El papel de la primera impresión en el aprendizaje operante" (PDF) . Journal of Experimental Psychology: General . 142 (2): 476– 488. doi : 10.1037/a0029550 . ISSN 1939-2222 . PMID 22924882 .  
  11. ^ Hasselt, Hado van (5 de marzo de 2012). "Aprendizaje por refuerzo en espacios de acción y estado continuo" . En Wiering, Marco; Otterlo, Martijn van (eds.). Aprendizaje por refuerzo: estado del arte . Medios de ciencia y negocios de Springer. págs. 207-251 . ISBN  978-3-642-27645-3.
  12. Tesauro, Gerald (marzo de 1995). "Aprendizaje por diferencia temporal y TD-Gammon" . Communications of the ACM . 38 (3): 58– 68. doi : 10.1145/203330.203343 . S2CID 8763243. Recuperado el 8 de febrero de 2010 . 
  13. Vincze, David (2017). "Interpolación de reglas difusas y aprendizaje por refuerzo" (PDF) . 2017 IEEE 15th International Symposium on Applied Machine Intelligence and Informatics (SAMI) . IEEE. pp. 173–178 . doi : 10.1109/SAMI.2017.7880298 . ISBN  978-1-5090-5655-2. S2CID 17590120 . 
  14. Krishnan, Srivatsan; Lam, Maximilian; Chitlangia, Sharad; Wan, Zishen; Barth-Maron, Gabriel; Faust, Aleksandra; Reddi, Vijay Janapa (13 de noviembre de 2022). "QuaRL: Cuantización para un aprendizaje por refuerzo rápido y ambientalmente sostenible". arXiv : 1910.01055 [ cs.LG ].
  15. Watkins, CJCH (1989). Aprender de las recompensas demoradas (PDF) (tesis doctoral). Universidad de Cambridge . EThOS uk.bl.ethos.330022 . 
  16. Watkins, Chris; Dayan, Peter (1992). "Q-learning" . Machine Learning . 8 ( 3–4 ): 279–292 . doi : 10.1007/BF00992698 . hdl : 21.11116/0000-0002-D738-D .
  17. Bozinovski, S. (15 de julio de 1999). «Crossbar Adaptive Array: La primera red conexionista que resolvió el problema del aprendizaje por refuerzo retardado» . En Dobnikar, Andrej; Steele, Nigel C.; Pearson, David W.; Albrecht, Rudolf F. (eds.). Redes neuronales artificiales y algoritmos genéticos: Actas de la Conferencia Internacional de Portorož, Eslovenia, 1999. Springer Science & Business Media. pp. 320–325 . ISBN  978-3-211-83364-3.
  18. Bozinovski, S. (1982). «Un sistema de autoaprendizaje mediante refuerzo secundario» . En Trappl, Robert (ed.). Cibernética e investigación de sistemas: Actas de la Sexta Reunión Europea sobre Cibernética e Investigación de Sistemas . North Holland. pp. 397–402 . ISBN  978-0-444-86488-8.
  19. Barto, A. (24 de febrero de 1997). «Aprendizaje por refuerzo» . En Omidvar, Omid; Elliott, David L. (eds.). Sistemas neuronales para el control . Elsevier. ISBN 978-0-08-053739-9.
  20. "Métodos y aparatos para el aprendizaje por refuerzo, patente estadounidense n.° 20150100530A1" (PDF) . Oficina de Patentes de los Estados Unidos. 9 de abril de 2015. Consultado el 28 de julio de 2018 .
  21. Matzliach B.; Ben-Gal I.; Kagan E. (2022). "Detección de objetivos estáticos y móviles por un agente autónomo con capacidades de aprendizaje Q profundo" . Entropy . 24 ( 8): 1168. Bibcode : 2022Entrp..24.1168M . doi : 10.3390/e24081168 . PMC 9407070. PMID 36010832 .  
  22. Mnih, Volodymyr; Kavukcuoglu, Koray; Silver, David; Rusu, Andrei A.; Veness, Joel; Bellemare, Marc G.; Graves, Alex; Riedmiller, Martin; Fidjeland, Andreas K. (feb. 2015). "Control a nivel humano mediante aprendizaje profundo por refuerzo". Nature . 518 ( 7540): 529– 533. Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . ISSN 0028-0836 . PMID 25719670. S2CID 205242740 .   
  23. van Hasselt, Hado (2011). "Aprendizaje Q doble" (PDF) . Avances en sistemas de procesamiento de información neuronal . 23 : 2613–2622 .
  24. van Hasselt, Hado; Guez, Arthur; Silver, David (8 de diciembre de 2015). "Aprendizaje profundo por refuerzo con doble Q-learning". arXiv : 1509.06461 [ cs.LG ].
  25. van Hasselt, Hado; Guez, Arthur; Silver, David (2015). "Aprendizaje profundo por refuerzo con doble Q-learning" (PDF) . Conferencia AAAI sobre Inteligencia Artificial : 2094–2100 . arXiv : 1509.06461 .
  26. Strehl, Alexander L.; Li, Lihong; Wiewiora, Eric; Langford, John; Littman, Michael L. (2006). "Aprendizaje por refuerzo sin modelo Pac" (PDF) . Actas de la 22.ª ICML : 881–888 .
  27. Maei, Hamid; Szepesvári, Csaba; Bhatnagar, Shalabh; Sutton, Richard (2010). "Hacia el control de aprendizaje fuera de política con aproximación de funciones en Actas de la 27.ª Conferencia Internacional sobre Aprendizaje Automático" (PDF) . págs. 719–726 . Archivado del original (PDF) el 8 de septiembre de 2012. Recuperado el 25 de enero de 2016 . 
  28. Hessel, Matteo; Modayil, Joseph; van Hasselt, Hado; Schaul, Tom; Ostrovski, Georg; Dabney, Will; Horgan, Dan; Piot, Bilal; Azar, Mohammad; Silver, David (febrero de 2018). "Rainbow: Combinando mejoras en el aprendizaje profundo por refuerzo". Actas de la Conferencia AAAI sobre Inteligencia Artificial . 32. arXiv : 1710.02298 . doi : 10.1609/aaai.v32i1.11796 . S2CID 19135734 . 
  29. Shoham, Yoav; Powers, Rob; Grenager, Trond (1 de mayo de 2007). "Si el aprendizaje multiagente es la respuesta, ¿cuál es la pregunta?" . Inteligencia Artificial . 171 (7): 365–377 . doi : 10.1016/j.artint.2006.02.006 . ISSN 0004-3702 . Recuperado el 4 de abril de 2023 . 
  30. Sen, Sandip; Sekaran, Mahendra; Hale, John (1 de agosto de 1994). "Aprender a coordinar sin compartir información" . Actas de la Duodécima Conferencia Nacional de la AAAI sobre Inteligencia Artificial . AAAI Press: 426–431 . Recuperado el 4 de abril de 2023 .
  31. Littman, Michael L. (10 de julio de 1994). «Los juegos de Markov como marco para el aprendizaje por refuerzo multiagente» . Actas de la Undécima Conferencia Internacional sobre Aprendizaje Automático . Morgan Kaufmann Publishers Inc.: 157–163 . ISBN 9781558603356. Consultado el 4 de abril de 2023 .
  32. Gaskett, Chris; Wettergreen, David; Zelinsky, Alexander (1999). "Q-Learning in Continuous State and Action Spaces" (PDF) .
  • Watkins, CJCH (1989). Aprender de las recompensas postergadas. Tesis doctoral, Universidad de Cambridge, Cambridge, Inglaterra.
  • Strehl, Li, Wiewiora, Langford, Littman (2006). Aprendizaje por refuerzo sin modelo PAC
  • Aprendizaje por refuerzo: una introducción, de Richard Sutton y Andrew S. Barto, un libro de texto en línea. Véase "6.5 Q-Learning: control TD fuera de política" .
  • Piqle: una plataforma Java genérica para el aprendizaje por refuerzo
  • "Laberinto de aprendizaje por refuerzo" . Archivado del original el 27 de septiembre de 2011.una demostración de cómo guiar a una hormiga a través de un laberinto usando Q -learning
  • " Trabajo sobre aprendizaje Q de Gerald Tesauro" . Archivado del original el 4 de junio de 2011.