Articulo de referencia

Problema del coche de montaña

El problema del coche de montaña Mountain Car , un dominio de prueba estándar en el aprendizaje por refuerzo , es un problema en el que un automóvil con poca potencia debe subir...

El problema del coche de montaña

Mountain Car , un dominio de prueba estándar en el aprendizaje por refuerzo , es un problema en el que un automóvil con poca potencia debe subir una pendiente pronunciada. Dado que la gravedad es más fuerte que el motor del automóvil, incluso a toda velocidad, el automóvil no puede simplemente acelerar por la pendiente pronunciada. El automóvil está situado en un valle y debe aprender a aprovechar la energía potencial subiendo la colina opuesta antes de poder llegar a la meta en la cima de la colina más a la derecha. El dominio se ha utilizado como banco de pruebas en varios artículos sobre aprendizaje por refuerzo .

Introducción

El problema del coche de montaña, aunque es bastante simple, se aplica comúnmente porque requiere que un agente de aprendizaje de refuerzo aprenda sobre dos variables continuas: posición y velocidad. Para cualquier estado dado (posición y velocidad) del coche, el agente tiene la posibilidad de conducir hacia la izquierda, hacia la derecha o no usar el motor en absoluto. En la versión estándar del problema, el agente recibe una recompensa negativa en cada paso de tiempo en el que no se alcanza el objetivo; el agente no tiene información sobre el objetivo hasta que se logra un éxito inicial.

Historia

El problema del coche de montaña apareció por primera vez en la tesis doctoral de Andrew Moore (1990). [1] Más tarde se definió de forma más estricta en el artículo de aprendizaje de refuerzo de Singh y Sutton con rastros de elegibilidad. [2] El problema se estudió más ampliamente cuando Sutton y Barto lo añadieron a su libro Reinforcement Learning: An Introduction (1998). [3] A lo largo de los años se han utilizado muchas versiones del problema, como las que modifican la función de recompensa , la condición de terminación y el estado de inicio .

Técnicas utilizadas para resolver problemas de coches de montaña

Es necesario ampliar el aprendizaje Q y otras técnicas similares para mapear estados discretos a acciones discretas para poder abordar el espacio de estados continuo del problema. Los enfoques a menudo se dividen en dos categorías: discretización del espacio de estados o aproximación de funciones .

Discretización

En este enfoque, dos variables de estado continuas se introducen en estados discretos agrupando cada variable continua en múltiples estados discretos. Este enfoque funciona con parámetros ajustados correctamente, pero tiene la desventaja de que la información recopilada de un estado no se utiliza para evaluar otro estado. La codificación de mosaicos se puede utilizar para mejorar la discretización e implica la asignación de variables continuas a conjuntos de grupos separados entre sí. Cada paso del entrenamiento tiene un impacto más amplio en la aproximación de la función de valor porque cuando se suman las cuadrículas de separación, la información se difunde. [4]

Aproximación de funciones

La aproximación de funciones es otra forma de resolver el problema del coche de montaña. Al elegir un conjunto de funciones base de antemano o al generarlas mientras el coche se desplaza, el agente puede aproximar la función de valor en cada estado. A diferencia de la versión escalonada de la función de valor creada con discretización, la aproximación de funciones puede estimar de forma más clara la verdadera función suave del dominio del coche de montaña. [5]

Rastros de elegibilidad

Un aspecto del problema implica el retraso de la recompensa real. El agente no puede aprender acerca del objetivo hasta que lo complete con éxito. Dado un enfoque ingenuo para cada prueba, el automóvil solo puede respaldar ligeramente la recompensa del objetivo. Esto es un problema para la discretización ingenua porque cada estado discreto solo se respaldará una vez, lo que requiere una mayor cantidad de episodios para aprender el problema. Este problema se puede aliviar mediante el mecanismo de rastros de elegibilidad, que respaldará automáticamente la recompensa otorgada a los estados anteriores, lo que aumenta drásticamente la velocidad de aprendizaje. Los rastros de elegibilidad se pueden considerar como un puente entre los métodos de aprendizaje de diferencia temporal y los métodos de Monte Carlo . [6]

Detalles técnicos

El problema del coche de montaña ha sufrido muchas iteraciones. Esta sección se centra en la versión estándar bien definida de Sutton (2008). [7]

Variables de estado

Espacio de estados continuo bidimensional.

V mi yo o do i a y = ( 0,07 , 0,07 ) {\displaystyle Velocidad=(-0.07,0.07)}

PAG o s i a i o norte = ( 1.2 , 0.6 ) {\displaystyle Posición=(-1.2,0.6)}

Comportamiento

Espacio de acción discreto unidimensional.

metro o a o a = ( yo mi F a , norte mi a a a yo , a i gramo yo a ) {\displaystyle motor=(izquierda,neutral,derecha)}

Premio

Para cada paso de tiempo:

a mi el a a d = 1 {\displaystyle recompensa=-1}

Función de actualización

Para cada paso de tiempo:

A do a i o norte = [ 1 , 0 , 1 ] {\displaystyle Acción=[-1,0,1]}

V mi yo o do i a y = V mi yo o do i a y + ( A do a i o norte ) 0,001 + porque ( 3 PAG o s i a i o norte ) ( 0,0025 ) {\displaystyle Velocidad=Velocidad+(Acción)*0,001+\cos(3*Posición)*(-0,0025)}

PAG o s i a i o norte = PAG o s i a i o norte + V mi yo o do i a y {\displaystyle Posición=Posición+Velocidad}

Condición inicial

Opcionalmente, muchas implementaciones incluyen aleatoriedad en ambos parámetros para mostrar un mejor aprendizaje generalizado.

PAG o s i a i o norte = 0,5 {\displaystyle Posición=-0.5}

V mi yo o do i a y = 0.0 {\displaystyle Velocidad=0.0}

Condición de terminación

Finalice la simulación cuando:

PAG o s i a i o norte 0.6 {\displaystyle Posición\geq 0.6}

Variaciones

Existen muchas versiones del coche de montaña que se desvían de diferentes maneras del modelo estándar. Las variables que varían incluyen, entre otras, el cambio de las constantes (gravedad y pendiente) del problema, de modo que el ajuste específico para políticas específicas se vuelve irrelevante, y la alteración de la función de recompensa para afectar la capacidad del agente de aprender de una manera diferente. Un ejemplo es cambiar la recompensa para que sea igual a la distancia desde el objetivo, o cambiar la recompensa a cero en todas partes y a uno en el objetivo. Además, se puede utilizar un coche de montaña en 3D, con un espacio de estados continuo en 4D. [8]

Referencias

  1. ^ [Moore, 1990] A. Moore, Aprendizaje eficiente basado en memoria para el control de robots, tesis doctoral, Universidad de Cambridge, noviembre de 1990.
  2. ^ [Singh y Sutton, 1996] Singh, SP y Sutton, RS (1996) Aprendizaje de refuerzo con reemplazo de rastros de elegibilidad. Aprendizaje automático 22(1/2/3):123-158.
  3. ^ [Sutton y Barto, 1998] Aprendizaje por refuerzo: una introducción. Richard S. Sutton y Andrew G. Barto. Un libro de Bradford. The MIT Press, Cambridge, Massachusetts, Londres, Inglaterra, 1998
  4. ^ "8.3.2 Codificación de mosaicos". Archivado desde el original el 28 de abril de 2012. Consultado el 14 de diciembre de 2011 .
  5. ^ "8.4 Control con aproximación de funciones". Archivado desde el original el 30 de abril de 2012 . Consultado el 14 de diciembre de 2011 .
  6. ^ Sutton, Richard S.; Barto, Andrew G.; Bach, Francis (13 de noviembre de 2018). "7. Rastros de elegibilidad". Aprendizaje por refuerzo: una introducción (segunda edición). Un libro de Bradford. ISBN 9780262039246.
  7. ^ [Sutton, 2008] Mountain Car Software. Richard S. Sutton. http://www.cs.ualberta.ca/~sutton/MountainCar/MountainCar.html Archivado el 12 de octubre de 2009 en Wayback Machine.
  8. ^ "Mountain Car 3D (CPP) - Biblioteca RL". Archivado desde el original el 26 de abril de 2012. Consultado el 14 de diciembre de 2011 .

Implementaciones

  • Software para coches de montaña en C++. Richard S. Sutton.
  • Coche Java Mountain con soporte para RL Glue
  • Python, con una buena discusión (publicación del blog, página siguiente)

Lectura adicional

  • Sutton, Richard S. (1996). Mountain Car with Sparse Coarse Coding. Avances en sistemas de procesamiento de información neuronal. MIT Press. págs. 1038–1044. CiteSeer x : 10.1.1.51.4764.
  • Coche de montaña con sustitución de rastros de elegibilidad
  • "Más discusión sobre espacios de estados continuos". 2000. pp. 903–910. CiteSeerX  10.1.1.97.9314 .
  • Procesos gaussianos con Mountain Car
Obtenido de "https://es.wikipedia.org/w/index.php?title=Problema_de_los_coches_de_montaña&oldid=1213318643"