Articulo de referencia

MuZero

MuZero es un programa informático desarrollado por la empresa de investigación de inteligencia artificial DeepMind , una subsidiaria de Google , para dominar juegos sin conocer ...

MuZero es un programa informático desarrollado por la empresa de investigación de inteligencia artificial DeepMind , una subsidiaria de Google , para dominar juegos sin conocer sus reglas y dinámicas subyacentes. [ 1 ] [ 2 ] [ 3 ] Su lanzamiento en 2019 incluyó pruebas de rendimiento en Go , ajedrez , shogi y una suite de 57 juegos diferentes de Atari . El algoritmo utiliza un enfoque similar a AlphaZero , donde se implementa una combinación de una búsqueda basada en árboles y un modelo aprendido. Igualó el rendimiento de AlphaZero en ajedrez y shogi, mejoró su rendimiento en Go y mejoró el estado del arte en el dominio de una suite de 57 juegos de Atari (el Arcade Learning Environment), un dominio visualmente complejo.

MuZero se entrenó mediante autoaprendizaje , sin acceso a reglas, libros de aperturas ni bases de datos de finales. El algoritmo entrenado utilizó la misma arquitectura convolucional y residual que AlphaZero, pero con un 20 por ciento menos de pasos de cálculo por nodo en el árbol de búsqueda. [ 4 ]

Historia

MuZero está descubriendo por sí mismo cómo construir un modelo y comprenderlo partiendo de los principios básicos.

David Silver, DeepMind, Wired [ 5 ]

El 19 de noviembre de 2019, el equipo de DeepMind publicó una versión preliminar en la que presentaba MuZero.

Derivación de AlphaZero

MuZero (MZ) combina la planificación de alto rendimiento del algoritmo AlphaZero (AZ) con enfoques de aprendizaje por refuerzo sin modelo. Esta combinación permite un entrenamiento más eficiente en sistemas de planificación clásicos, como el Go, a la vez que gestiona dominios con entradas mucho más complejas en cada etapa, como los videojuegos visuales.

MuZero se derivó directamente del código AZ, compartiendo sus reglas para establecer hiperparámetros . Las diferencias entre los enfoques incluyen: [ 6 ]

  • El proceso de planificación de AZ utiliza un simulador . El simulador conoce las reglas del juego y debe programarse explícitamente. Una red neuronal predice la política y el valor de una posición futura. El conocimiento perfecto de las reglas del juego se utiliza para modelar las transiciones de estado en el árbol de búsqueda, las acciones disponibles en cada nodo y la terminación de una rama del árbol. MZ no tiene acceso a las reglas y, en su lugar, aprende una mediante redes neuronales.
  • AZ tiene un único modelo para el juego (desde el estado del tablero hasta las predicciones); MZ tiene modelos separados para la representación del estado actual (desde el estado del tablero hasta su incrustación interna), la dinámica de los estados (cómo las acciones cambian las representaciones de los estados del tablero) y la predicción de la política y el valor de una posición futura (dada la representación de un estado).
  • El modelo oculto de MZ puede ser complejo, y es posible que resulte que pueda albergar cálculos; explorar los detalles del modelo oculto en una instancia entrenada de MZ es un tema para futuras investigaciones.
  • MZ no contempla juegos de dos jugadores donde el ganador se lo lleva todo. Funciona con escenarios estándar de aprendizaje por refuerzo, incluyendo entornos de un solo agente con recompensas intermedias continuas, posiblemente de magnitud arbitraria y con descuento temporal. AZ fue diseñado para juegos de dos jugadores que pueden ganarse, empatarse o perderse.

Comparación con R2D2

La técnica más avanzada hasta la fecha para aprender a jugar a la suite de juegos de Atari era R2D2, el DQN distribuido de repetición recurrente. [ 7 ]

MuZero superó tanto el rendimiento medio como la mediana de R2D2 en el conjunto de juegos, aunque no lo hizo mejor en todos ellos.

Formación y resultados

MuZero utilizó 16 unidades de procesamiento tensorial (TPU) de tercera generación para el entrenamiento y 1000 TPU para el autoaprendizaje de juegos de mesa, con 800 simulaciones por paso, y 8 TPU para el entrenamiento y 32 TPU para el autoaprendizaje de juegos de Atari, con 50 simulaciones por paso.

AlphaZero utilizó 64 TPU de segunda generación para el entrenamiento y 5000 TPU de primera generación para el juego por cuenta propia. Dado que el diseño de las TPU ha mejorado (los chips de tercera generación son el doble de potentes individualmente que los de segunda generación, con avances adicionales en el ancho de banda y la interconexión entre chips en un mismo módulo), estas configuraciones de entrenamiento son comparables.

R2D2 fue entrenado durante 5 días a través de 2 millones de pasos de entrenamiento.

Resultados iniciales

MuZero igualó el rendimiento de AlphaZero en ajedrez y shogi tras aproximadamente un millón de pasos de entrenamiento. Igualó el rendimiento de AZ en Go tras 500 000 pasos de entrenamiento y lo superó por un millón de pasos. Igualó el rendimiento medio y mediano de R2D2 en toda la suite de juegos de Atari tras 500 000 pasos de entrenamiento y lo superó por un millón de pasos, aunque nunca tuvo un buen desempeño en 6 juegos de la suite.

MuZero fue visto como un avance significativo con respecto a AlphaZero y un paso adelante generalizable en las técnicas de aprendizaje no supervisado. [ 8 ] [ 9 ] El trabajo fue visto como un avance en la comprensión de cómo componer sistemas a partir de componentes más pequeños, un desarrollo a nivel de sistemas más que un desarrollo de aprendizaje automático puro. [ 10 ]

Aunque el equipo de desarrollo solo publicó pseudocódigo, Werner Duvaud produjo una implementación de código abierto basada en él. [ 11 ]

MuZero se ha utilizado como implementación de referencia en otros trabajos, por ejemplo, como una forma de generar comportamiento basado en modelos. [ 12 ]

A finales de 2021, se propuso una variante más eficiente de MuZero, denominada EfficientZero. Esta variante "alcanza un rendimiento humano medio del 194,3 % y un rendimiento mediano del 109,0 % en la prueba de rendimiento Atari 100k con tan solo dos horas de experiencia de juego en tiempo real". [ 13 ]

A principios de 2022, se propuso una variante de MuZero para jugar juegos estocásticos (por ejemplo, 2048 , backgammon ), llamada Stochastic MuZero, que utiliza dinámicas de estado posterior y códigos de probabilidad para tener en cuenta la naturaleza estocástica del entorno al entrenar la red dinámica. [ 14 ]

En febrero de 2022, DeepMind informó sobre la primera aplicación de MuZero a una tarea del mundo real, en colaboración con YouTube para mejorar la compresión de vídeo en el códec de código abierto VP9. Una versión llamada MuZero-RC reemplazó el mecanismo de control de tasa predeterminado de VP9, ​​seleccionando el parámetro de cuantificación para cada fotograma, y ​​logró una reducción promedio del 4 % en la tasa de bits en un conjunto diverso de vídeos sin degradación de la calidad. [ 15 ]

Véase también

Referencias

  1. Wiggers, Kyle (20 de noviembre de 2019). "MuZero de DeepMind aprende por sí mismo a ganar en Atari, ajedrez, shogi y Go" . VentureBeat . Consultado el 22 de julio de 2020 .
  2. Friedel, Frederic. "MuZero descifra el ajedrez, reglas y todo" . ChessBase GmbH . Consultado el 22 de julio de 2020 .
  3. Rodríguez, Jesús. "DeepMind presenta a MuZero, un nuevo agente que dominó el ajedrez, el shogi, el atari y el go sin conocer las reglas" . KDnuggets . Consultado el 22 de julio de 2020 .
  4. Schrittwieser, Julián; Antonoglou, Ioannis; Hubert, Thomas; Simonyan, Karen; Sifré, Laurent; Schmitt, Simón; Guez, Arturo; Lockhart, Eduardo; Hassabis, Demis; Graepel, Thore; Lillicrap, Timoteo (2020). "Dominar Atari, Go, ajedrez y shogi planificando con un modelo aprendido". Naturaleza . 588 (7839): 604– 609. arXiv : 1911.08265 . Código Bib : 2020Natur.588..604S . doi : 10.1038/s41586-020-03051-4 . PMID 33361790 . S2CID 208158225 .  
  5. "Lo que AlphaGo puede enseñarnos sobre cómo aprenden las personas" . Wired . ISSN 1059-1028 . Consultado el 25 de diciembre de 2020 . 
  6. Silver, David ; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan ; Graepel, Thore; Lillicrap, Timothy; Simonyan, Karen; Hassabis, Demis (5 de diciembre de 2017). "Dominando el ajedrez y el shogi mediante el autoaprendizaje con un algoritmo general de aprendizaje por refuerzo". arXiv : 1712.01815 [ cs.AI ].
  7. Kapturowski, Steven; Ostrovski, Georg; Quan, John; Munos, Remi; Dabney, Will. REPRODUCCIÓN DE EXPERIENCIAS RECURRENTES EN EL APRENDIZAJE DE REFUERZO DISTRIBUIDO . ICLR 2019 vía Open Review.
  8. Shah, Rohin (27 de noviembre de 2019). " [ AN #75 ] : Resolviendo Atari y Go con modelos de juego aprendidos y reflexiones de un empleado de MIRI - LessWrong 2.0" . www.lesswrong.com . Recuperado el 7 de junio de 2020 .
  9. Wu, Jun. "Aprendizaje por refuerzo, el socio del aprendizaje profundo" . Forbes . Consultado el 15 de julio de 2020 .
  10. "Aprendizaje automático y robótica: mi (sesgada) opinión sobre el estado del campo en 2019" . cachestocaches.com . Consultado el 15 de julio de 2020 .
  11. Duvaud, Werner (15 de julio de 2020), werner-duvaud/muzero-general , consultado el 15 de julio de 2020
  12. van Seijen, Harm; Nekoei, Hadi; Racah, Evan; Chandar, Sarath (2020-07-06). "The LoCA Regret: A Consistent Metric to Evaluate Model-Based Behavior in Reinforcement Learning". arXiv : 2007.03158 [ cs.stat ].
  13. Ye, Weirui; Liu, Shaohuai; Kurutach, Thanard; Abbeel, Pieter; Gao, Yang (2021-12-11). "Dominando los juegos de Atari con datos limitados". arXiv : 2111.00210 [ cs.LG ].
  14. Antonoglou, Ioannis; Schrittwieser, Julian; Ozair, Serjil; Hubert, Thomas; Silver, David (28 de enero de 2022). "Planificación en entornos estocásticos con un modelo aprendido" . Recuperado el 12 de diciembre de 2023 .
  15. "El primer paso de MuZero de la investigación al mundo real" . DeepMind. 11 de febrero de 2022. Consultado el 20 de junio de 2026 .
  • Preimpresión inicial de MuZero
  • Implementaciones de código abierto