Articulo de referencia

Aprendizaje por diferencia temporal

El aprendizaje por diferencia temporal ( TD ) se refiere a una clase de métodos de aprendizaje por refuerzo sin modelo que aprenden mediante el remuestreo (bootstrapping) a part...

El aprendizaje por diferencia temporal ( TD ) se refiere a una clase de métodos de aprendizaje por refuerzo sin modelo que aprenden mediante el remuestreo (bootstrapping) a partir de la estimación actual de la función de valor. Estos métodos toman muestras del entorno, como los métodos de Monte Carlo , y realizan actualizaciones basadas en las estimaciones actuales, como los métodos de programación dinámica . [ 1 ]

Mientras que los métodos de Monte Carlo solo ajustan sus estimaciones una vez que se conoce el resultado, los métodos TD ajustan las predicciones para que coincidan con predicciones posteriores y más precisas sobre el futuro, antes de que se conozca el resultado. [ 2 ] Esta es una forma de remuestreo (bootstrapping ), como se ilustra con el siguiente ejemplo:

Supongamos que desea predecir el tiempo para el sábado y dispone de un modelo que lo predice basándose en el tiempo de cada día de la semana. En el caso habitual, esperaría hasta el sábado y luego ajustaría todos sus modelos. Sin embargo, si es, por ejemplo, viernes, debería tener una idea bastante clara de cómo será el tiempo el sábado y, por lo tanto, podría modificar el modelo del sábado antes de que llegue ese día. [ 2 ]

Los métodos de diferencia temporal están relacionados con el modelo de diferencia temporal del aprendizaje animal . [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ]

Formulación matemática

El método TD(0) tabular es uno de los métodos TD más simples. Es un caso especial de métodos de aproximación estocástica más generales. Estima la función de valor de estado de un proceso de decisión de Markov (MDP) de estado finito bajo una políticaπ{\displaystyle \pi }. DejarVπ{\displaystyle V^{\pi }}denotamos la función de valor de estado del MDP con estados(St)tnorte{\displaystyle (S_{t})_{t\in \mathbb {N} }}, recompensas(Rt)tnorte{\displaystyle (R_{t})_{t\in \mathbb {N} }}y tasa de descuento [ 8 ]γ{\displaystyle \gamma }bajo la políticaπ{\displaystyle \pi }: [ 9 ]

Vπ(s)=miaπ{t=0γtRt+1|S0=s}.{\displaystyle V^{\pi }(s)=E_{a\sim \pi }\left\{\sum _{t=0}^{\infty }\gamma ^{t}R_{t+1}{\Bigg |}S_{0}=s\right\}.}

Por comodidad, omitimos la acción de la notación.Vπ{\displaystyle V^{\pi }}satisface la ecuación de Bellman :

Vπ(s)=miπ{R1+γVπ(S1)|S0=s},{\displaystyle V^{\pi }(s)=E_{\pi }\{R_{1}+\gamma V^{\pi }(S_{1})|S_{0}=s\},}

entoncesR1+γVπ(S1){\displaystyle R_{1}+\gamma V^{\pi }(S_{1})}es una estimación imparcial paraVπ(s){\displaystyle V^{\pi }(s)}Esta observación motiva el siguiente algoritmo para estimarVπ{\displaystyle V^{\pi }}.

El algoritmo comienza inicializando una tabla.V(s){\displaystyle V(s)}arbitrariamente, con un valor para cada estado del MDP. Una tasa de aprendizaje positiva.α{\displaystyle \alpha }es elegido.

Luego evaluamos repetidamente la política.π{\displaystyle \pi }, obtener una recompensar{\displaystyle r}y actualiza la función de valor para el estado actual usando la regla: [ 10 ]

V(St)(1α)V(St)+αtasa de aprendizaje[Rt+1+γV(St+1)El objetivo TD]{\displaystyle V(S_{t})\leftarrow (1-\alpha )V(S_{t})+\underbrace {\alpha } _{\text{tasa de aprendizaje}}[\overbrace {R_{t+1}+\gamma V(S_{t+1})} ^{\text{El objetivo TD}}]}

dóndeSt{\displaystyle S_{t}}ySt+1{\displaystyle S_{t+1}}son los estados actual y siguiente, respectivamente. El valorRt+1+γV(St+1){\displaystyle R_{t+1}+\gamma V(S_{t+1})}se conoce como el objetivo TD, yRt+1+γV(St+1)V(St){\displaystyle R_{t+1}+\gamma V(S_{t+1})-V(S_{t})}Se conoce como error TD.

TD-Lambda

TD-Lambda es un algoritmo de aprendizaje inventado por Richard S. Sutton, basado en trabajos previos sobre aprendizaje por diferencia temporal realizados por Arthur Samuel . [ 11 ] Este algoritmo fue aplicado de forma destacada por Gerald Tesauro para crear TD-Gammon , un programa que aprendió a jugar al backgammon al nivel de jugadores humanos expertos. [ 12 ]

La lambda (λ{\displaystyle \lambda }El parámetro ) se refiere al parámetro de decaimiento de traza, con0λ1{\displaystyle 0\leqslant \lambda \leqslant 1}. Los ajustes más altos dan lugar a huellas más duraderas; es decir, se puede dar una mayor proporción de crédito de una recompensa a estados y acciones más distantes cuandoλ{\displaystyle \lambda }es más alto, conλ=1{\displaystyle \lambda =1}producir aprendizaje paralelo a algoritmos de aprendizaje por refuerzo de Monte Carlo. [ 13 ]

En neurociencia

El algoritmo TD también ha recibido atención en el campo de la neurociencia . Los investigadores descubrieron que la tasa de disparo de las neuronas dopaminérgicas en el área tegmental ventral (VTA) y la sustancia negra (SNc) parecen imitar la función de error en el algoritmo. [ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] La función de error informa la diferencia entre la recompensa estimada en cualquier estado o paso de tiempo dado y la recompensa real recibida. Cuanto mayor sea la función de error, mayor será la diferencia entre la recompensa esperada y la real. Cuando esto se combina con un estímulo que refleja con precisión una recompensa futura, el error puede usarse para asociar el estímulo con la recompensa futura .

Las células dopaminérgicas parecen comportarse de manera similar. En un experimento, se realizaron mediciones de células dopaminérgicas mientras se entrenaba a un mono para asociar un estímulo con la recompensa de jugo. [ 14 ] Inicialmente, las células dopaminérgicas aumentaron sus tasas de disparo cuando el mono recibió jugo, lo que indica una diferencia entre las recompensas esperadas y las reales. Con el tiempo, este aumento en el disparo se propagó hacia el primer estímulo confiable para la recompensa. Una vez que el mono estuvo completamente entrenado, no hubo aumento en la tasa de disparo al presentarse la recompensa predicha. Posteriormente, la tasa de disparo de las células dopaminérgicas disminuyó por debajo de la activación normal cuando no se produjo la recompensa esperada. Esto imita de cerca cómo se utiliza la función de error en TD para el aprendizaje por refuerzo .

La relación entre el modelo y la función neurológica potencial ha dado lugar a investigaciones que intentan utilizar la TD para explicar muchos aspectos de la investigación conductual. [ 15 ] [ 16 ] También se ha utilizado para estudiar afecciones como la esquizofrenia o las consecuencias de las manipulaciones farmacológicas de la dopamina en el aprendizaje. [ 17 ]

Véase también

Notas

  1. Sutton y Barto (2018) , pág. 133.
  2. 1 2 Sutton, Richard S. (1 de agosto de 1988). "Aprendizaje para predecir mediante métodos de diferencias temporales" . Machine Learning . 3 (1): 9– 44. doi : 10.1007/BF00115009 . ISSN 1573-0565 . S2CID 207771194 .  
  3. 1 2 Schultz, W, Dayan, P y Montague, PR. (1997). "Un sustrato neural de predicción y recompensa". Science . 275 (5306): 1593– 1599. CiteSeerX 10.1.1.133.6176 . doi : 10.1126/science.275.5306.1593 . PMID 9054347 . S2CID 220093382 .   {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  4. 1 2 Montague, PR; Dayan, P.; Sejnowski, TJ (1996-03-01). "Un marco para los sistemas dopaminérgicos mesencefálicos basado en el aprendizaje hebbiano predictivo" ( PDF) . The Journal of Neuroscience . 16 (5): 1936– 1947. doi : 10.1523/JNEUROSCI.16-05-01936.1996 . ISSN 0270-6474 . PMC 6578666. PMID 8774460 .   
  5. 1 2 Montague, PR; Dayan, P.; Nowlan, SJ; Pouget, A.; Sejnowski, TJ (1993). "Uso del refuerzo aperiódico para la autoorganización dirigida" (PDF) . Advances in Neural Information Processing Systems . 5 : 969–976 .
  6. 1 2 Montague, PR; Sejnowski, TJ (1994). "El cerebro predictivo: coincidencia temporal y orden temporal en los mecanismos de aprendizaje sináptico" . Aprendizaje y Memoria . 1 (1): 1– 33. doi : 10.1101/lm.1.1.1 . ISSN 1072-0502 . PMID 10467583. S2CID 44560099 .   
  7. 1 2 Sejnowski, TJ; Dayan, P.; Montague, PR (1995). "Aprendizaje hebbiano predictivo". Actas de la octava conferencia anual sobre teoría del aprendizaje computacional - COLT '95 . págs. 15–18 . doi : 10.1145/225298.225300 . ISBN  0897917235. S2CID 1709691 . 
  8. El parámetro de tasa de descuento permite una preferencia temporal hacia recompensas más inmediatas y un alejamiento de las recompensas futuras lejanas.
  9. Sutton y Barto (2018) , pág. 134.
  10. Sutton y Barto (2018) , pág. 135.
  11. Sutton y Barto (2018) , pág. 130?.
  12. Tesauro (1995) .
  13. Sutton y Barto (2018) , pág. 175.
  14. Schultz, W. (1998). "Señal predictiva de recompensa de las neuronas dopaminérgicas". Journal of Neurophysiology . 80 (1): 1– 27. CiteSeerX 10.1.1.408.5994 . doi : 10.1152/jn.1998.80.1.1 . PMID 9658025. S2CID 52857162 .   
  15. Dayan, P. (2001). "Aprendizaje por refuerzo motivado" (PDF) . Advances in Neural Information Processing Systems . 14. MIT Press: 11–18 . Archivado del original (PDF) el 25 de mayo de 2012. Recuperado el 3 de marzo de 2009 .
  16. Tobia, MJ, et al. (2016). "Respuesta conductual y neuronal alterada a ganancias contrafactuales en ancianos" . Neurociencia Cognitiva, Afectiva y Conductual . 16 (3): 457– 472. doi : 10.3758 / s13415-016-0406-7 . PMID 26864879. S2CID 11299945 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  17. Smith, A., Li, M., Becker, S. y Kapur, S. (2006). "Dopamina, error de predicción y aprendizaje asociativo: una explicación basada en modelos". Network : Computation in Neural Systems . 17 (1): 61– 84. doi : 10.1080/09548980500361624 . PMID 16613795. S2CID 991839 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )

Obras citadas

  • Sutton, Richard S.; Barto, Andrew G. (2018). Aprendizaje por refuerzo: una introducción (2.ª  ed.). Cambridge, MA: MIT Press.
  • Tesauro, Gerald (marzo de 1995). "Aprendizaje por diferencia temporal y TD-Gammon" . Communications of the ACM . 38 (3): 58– 68. doi : 10.1145/203330.203343 . S2CID 6023746 . 

Lecturas adicionales

  • Meyn, SP (2007). Técnicas de control para redes complejas . Cambridge University Press. ISBN 978-0521884419.Véase el capítulo final y el apéndice.
  • Sutton, RS; Barto, AG (1990). "Modelos de derivada temporal del refuerzo pavloviano" (PDF) . Aprendizaje y neurociencia computacional: fundamentos de redes adaptativas : 497–537 . Archivado del original (PDF) el 30 de marzo de 2017. Recuperado el 29 de marzo de 2017 .
  • Applet Connect Four TDGravity archivado el 24/07/2012 en Wayback Machine (+ versión para teléfono móvil) – autoaprendizaje mediante el método TD-Leaf (combinación de TD-Lambda con búsqueda en árbol superficial)
  • Autoaprendizaje Meta-Tic-Tac-Toe Archivado el 19/03/2014 en Wayback Machine Ejemplo de aplicación web que muestra cómo se puede utilizar el aprendizaje por diferencia temporal para aprender constantes de evaluación de estado para una IA minimax que juega un juego de mesa simple.
  • Problema de aprendizaje por refuerzo , documento que explica cómo se puede utilizar el aprendizaje por diferencia temporal para acelerar el aprendizaje Q.
  • TD-Simulator Simulador de diferencia temporal para condicionamiento clásico