Articulo de referencia

Aprendizaje por imitación

El aprendizaje por imitación es un paradigma del aprendizaje por refuerzo , donde un agente aprende a realizar una tarea mediante aprendizaje supervisado a partir de demostracio...

El aprendizaje por imitación es un paradigma del aprendizaje por refuerzo , donde un agente aprende a realizar una tarea mediante aprendizaje supervisado a partir de demostraciones de expertos [ 1 ] . También se denomina aprendizaje por demostración y aprendizaje por aprendizaje práctico [ 2 ] [ 3 ] [ 4 ].

Se ha aplicado a la robótica subactuada, [ 5 ] coches autónomos, [ 6 ] [ 7 ] [ 8 ] navegación de cuadricópteros, [ 9 ] acrobacias aéreas con helicópteros, [ 10 ] y locomoción. [ 11 ] [ 12 ]

Aproches

Las demostraciones de expertos son grabaciones de un experto realizando la tarea deseada, a menudo recopiladas como pares estado-acción.(ot,at){\displaystyle (o_{t}^{*},a_{t}^{*})}.

Clonación de comportamiento

La clonación de comportamiento (BC) es la forma más básica de aprendizaje por imitación. Esencialmente, utiliza el aprendizaje supervisado para entrenar una política.πθ{\displaystyle \pi _{\theta }}de tal manera que, dada una observaciónot{\displaystyle o_{t}}generaría una distribución de acciones.πθ(|ot){\displaystyle \pi _{\theta }(\cdot |o_{t})}eso es aproximadamente lo mismo que la distribución de acciones de los expertos. [ 13 ]

BC es susceptible a cambios en la distribución . Específicamente, si la política entrenada difiere de la política experta, podría desviarse de la trayectoria experta hacia observaciones que nunca habrían ocurrido en las trayectorias expertas. [ 13 ]

Esto ya lo había señalado ALVINN , que entrenó una red neuronal para conducir una furgoneta utilizando demostraciones humanas. Observaron que, dado que un conductor humano nunca se desvía mucho de la trayectoria, la red nunca sería entrenada para saber qué acción tomar si alguna vez se encontrara muy lejos de ella. [ 6 ]

Daga

DAgger ( Agregación de conjuntos de datos ) [ 14 ] mejora la clonación de comportamientos mediante el entrenamiento iterativo en un conjunto de datos de demostraciones de expertos. En cada iteración, el algoritmo primero recopila datos implementando la política aprendida.πθ{\displaystyle \pi _{\theta }}Luego, consulta al experto para obtener la acción óptima.at{\displaystyle a_{t}^{*}}en cada observaciónot{\displaystyle o_{t}}encontrados durante el despliegue. Finalmente, agrega los nuevos datos al conjunto de datos.DD{(o1,a1),(o2,a2),...,(oT,aT)}{\displaystyle D\leftarrow D\cup \{(o_{1},a_{1}^{*}),(o_{2},a_{2}^{*}),...,(o_{T},a_{T}^{*})\}}y entrena una nueva política en el conjunto de datos agregado. [ 13 ]

Transformador de decisiones

Diagrama arquitectónico del transformador de decisiones

El enfoque Decision Transformer modela el aprendizaje por refuerzo como un problema de modelado de secuencias. [ 15 ] De manera similar a Behavior Cloning, entrena un modelo de secuencia, como un Transformer , que modela secuencias de despliegue.(R1,o1,a1),(R2,o2,a2),,(Rt,ot,at),{\displaystyle (R_{1},o_{1},a_{1}),(R_{2},o_{2},a_{2}),\dots ,(R_{t},o_{t},a_{t}),}dóndeRt=rt+rt+1++rT{\displaystyle R_{t}=r_{t}+r_{t+1}+\dots +r_{T}}es la suma de la recompensa futura en el despliegue. Durante el tiempo de entrenamiento, el modelo de secuencia se entrena para predecir cada acción.at{\displaystyle a_{t}}, teniendo en cuenta el lanzamiento anterior como contexto:(R1,o1,a1),(R2,o2,a2),,(Rt,ot){\displaystyle (R_{1},o_{1},a_{1}),(R_{2},o_{2},a_{2}),\dots ,(R_{t},o_{t})}Durante el tiempo de inferencia, para utilizar el modelo de secuencia como un controlador eficaz, simplemente se le proporciona una predicción de recompensa muy alta.R{\displaystyle R}y se generalizaría prediciendo una acción que resultaría en una alta recompensa. Se demostró que esto se escalaba de manera predecible a un Transformer con mil millones de parámetros que es sobrehumano en 41 juegos de Atari . [ 16 ]

Otros enfoques

Consulte [ 17 ] [ 18 ] para ver más ejemplos.

El aprendizaje por refuerzo inverso (IRL) aprende una función de recompensa que explica el comportamiento del experto y luego utiliza el aprendizaje por refuerzo para encontrar una política que maximice esta recompensa. [ 19 ] Trabajos recientes también han explorado extensiones multiagente de IRL en sistemas en red. [ 20 ]

El aprendizaje por imitación generativa adversaria (GAIL) utiliza redes generativas adversarias (GAN) para hacer coincidir la distribución del comportamiento del agente con la distribución de las demostraciones de expertos. [ 21 ] Extiende un enfoque anterior que utiliza la teoría de juegos. [ 22 ] [ 17 ]

Véase también

Lecturas adicionales

  • Hussein, Ahmed; Gaber, Mohamed Medhat; Elyan, Eyad; Jayne, Chrisina (2018-03-31). "Aprendizaje por imitación: una revisión de los métodos de aprendizaje" . ACM Computing Surveys . 50 (2): 1– 35. doi : 10.1145/3054912 . hdl : 10059/2298 . ISSN 0360-0300 . 

Referencias

  1. Wei, Yusi; Arvin, Farshad; Hu, Junyan (2026). "Clonación de comportamiento con restricciones de Lyapunov para un seguimiento robusto de la trayectoria en la conducción autónoma". IEEE Transactions on Vehicular Technology . doi : 10.1109/TVT.2026.3682470 .
  2. Russell, Stuart J.; Norvig, Peter (2021). «22.6 Aprendizaje por aprendizaje y aprendizaje por refuerzo inverso». Inteligencia artificial: un enfoque moderno . Serie Pearson en inteligencia artificial (Cuarta ed.). Hoboken: Pearson. ISBN  978-0-13-461099-3.
  3. Sutton, Richard S.; Barto, Andrew G. (2018). Aprendizaje por refuerzo: una introducción . Serie de computación adaptativa y aprendizaje automático (Segunda edición). Cambridge, Massachusetts: The MIT Press. pág. 470. ISBN   978-0-262-03924-6.
  4. Hussein, Ahmed; Gaber, Mohamed Medhat; Elyan, Eyad; Jayne, Chrisina (2017-04-06). "Aprendizaje por imitación: una revisión de los métodos de aprendizaje" . ACM Comput. Surv . 50 (2): 21:1–21:35. doi : 10.1145/3054912 . hdl : 10059/2298 . ISSN 0360-0300 . 
  5. "Cap. 21 - Aprendizaje por imitación" . underactuated.mit.edu . Consultado el 8 de agosto de 2024 .
  6. 1 2 Pomerleau, Dean A. (1988). "ALVINN: Un vehículo terrestre autónomo en una red neuronal" . Avances en sistemas de procesamiento de información neuronal . 1. Morgan-Kaufmann.
  7. Bojarski, Mariusz; Del Testa, Davide; Dworakowski, Daniel; Firner, Bernhard; Flepp, Beat; Goyal, Prasoon; Jackel, Lawrence D.; Monfort, Mathew; Muller, Urs (2016-04-25). "End to End Learning for Self-Driving Cars". arXiv : 1604.07316v1 [ cs.CV ].
  8. Kiran, B Ravi; Sobh, Ibrahim; Talpaert, Victor; Mannion, Patrick; Sallab, Ahmad A. Al; Yogamani, Senthil; Perez, Patrick (junio de 2022). "Aprendizaje profundo por refuerzo para la conducción autónoma: una revisión". IEEE Transactions on Intelligent Transportation Systems . 23 (6): 4909– 4926. arXiv : 2002.00444 . Bibcode : 2022ITITr..23.4909K . doi : 10.1109/TITS.2021.3054625 . ISSN 1524-9050 . 
  9. Giusti, Alessandro; Guzzi, Jerome; Ciresan, Dan C.; He, Fang-Lin; Rodriguez, Juan P.; Fontana, Flavio; Faessler, Matthias; Forster, Christian; Schmidhuber, Jurgen; Caro, Gianni Di; Scaramuzza, Davide; Gambardella, Luca M. (julio de 2016). "Un enfoque de aprendizaje automático para la percepción visual de senderos forestales para robots móviles" (PDF) . IEEE Robotics and Automation Letters . 1 (2): 661– 667. Bibcode : 2016IRAL....1..661G . doi : 10.1109/LRA.2015.2509024 . ISSN 2377-3766 . 
  10. "Helicóptero autónomo: Laboratorio de IA de la Universidad de Stanford" . heli.stanford.edu . Consultado el 8 de agosto de 2024 .
  11. ^ Nakanishi, junio; Morimoto, junio; Endo, gen; Cheng, Gordon; Schal, Stefan; Kawato, Mitsuo (junio de 2004). "Aprendiendo de la demostración y adaptación de la locomoción bípeda" . Robótica y Sistemas Autónomos . 47 ( 2– 3): 79– 91. doi : 10.1016/j.robot.2004.03.003 .
  12. ^ Kalakrishnan, Mrinal; Buchli, Jonás; Pastor, Pedro; Schaal, Stefan (octubre de 2009). "Aprender la locomoción sobre terreno accidentado mediante plantillas de terreno" . Conferencia internacional IEEE/RSJ 2009 sobre robots y sistemas inteligentes . IEEE. págs. 167-172 . doi : 10.1109/iros.2009.5354701 . ISBN  978-1-4244-3803-7.
  13. 1 2 3 CS 285 en UC Berkeley: Aprendizaje por refuerzo profundo. Lección 2: Aprendizaje supervisado de comportamientos
  14. Ross, Stephane; Gordon, Geoffrey; Bagnell, Drew (14 de junio de 2011). "Una reducción del aprendizaje por imitación y la predicción estructurada al aprendizaje en línea sin arrepentimiento" . Actas de la Decimocuarta Conferencia Internacional sobre Inteligencia Artificial y Estadística . Actas de talleres y conferencias de JMLR: 627–635 .
  15. Chen, Lili; Lu, Kevin; Rajeswaran, Aravind; Lee, Kimin; Grover, Aditya; Laskin, Misha; Abbeel, Pieter; Srinivas, Aravind; Mordatch, Igor (2021). "Decision Transformer: Reinforcement Learning via Sequence Modeling" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 15084–15097 . arXiv : 2106.01345 .
  16. Lee, Kuang-Huei; Nachum, Ofir; Yang, Mengjiao; Lee, Lisa; Freeman, Daniel; Xu, Winnie; Guadarrama, Sergio; Fischer, Ian; Jang, Eric (15 de octubre de 2022), Multi-Game Decision Transformers , arXiv : 2205.15241
  17. 1 2 Hester, Todd; Vecerik, Matej; Pietquin, Olivier; Lanctot, Marc; Schaul, Tom; Piot, Bilal; Horgan, Dan; Quan, John; Sendonaris, Andrew (2017-04-12). "Aprendizaje Q profundo a partir de demostraciones". arXiv : 1704.03732v4 [ cs.AI ].
  18. Duan, Yan; Andrychowicz, Marcin; Stadie, Bradly; Jonathan Ho, OpenAI; Schneider, Jonas; Sutskever, Ilya; Abbeel, Pieter; Zaremba, Wojciech (2017). "Aprendizaje por imitación de una sola muestra" . Avances en sistemas de procesamiento de información neuronal . 30. Curran Associates, Inc.
  19. A, Ng (2000). "Algoritmos para el aprendizaje por refuerzo inverso" . Actas de la 17.ª Conferencia Internacional sobre Aprendizaje Automático, 2000 : 663–670 .
  20. VS Donge, B. Lian, FL Lewis y A. Davoudi, "Juegos gráficos multiagente con aprendizaje por refuerzo inverso", en IEEE Transactions on Control of Network Systems, vol. 10, n.º 2, págs. 841-852, junio de 2023, doi:10.1109/TCNS.2022.3210856.
  21. Ho, Jonathan; Ermon, Stefano (2016). "Aprendizaje de imitación adversaria generativa" . Avances en sistemas de procesamiento de información neuronal . 29. Curran Associates, Inc. arXiv : 1606.03476 .
  22. Syed, Umar; Schapire, Robert E (2007). "Un enfoque de teoría de juegos para el aprendizaje por aprendizaje" . Avances en sistemas de procesamiento de información neuronal . 20. Curran Associates, Inc.