Articulo de referencia

AlphaZero

AlphaZero es un programa informático desarrollado por la empresa de investigación en inteligencia artificial DeepMind para dominar los juegos de ajedrez , shogi y go . Este algo...

AlphaZero es un programa informático desarrollado por la empresa de investigación en inteligencia artificial DeepMind para dominar los juegos de ajedrez , shogi y go . Este algoritmo utiliza un enfoque similar al de AlphaGo Zero .

El 5 de diciembre de 2017, el equipo de DeepMind publicó un artículo preliminar que presentaba a AlphaZero, [ 1 ] que pronto jugaría tres partidas derrotando a los motores de ajedrez campeones del mundo Stockfish y Elmo , y la versión de tres días de AlphaGo Zero. En cada caso, utilizó unidades de procesamiento tensorial (TPU) personalizadas que los programas de Google estaban optimizados para usar. [ 1 ] AlphaZero fue entrenado únicamente mediante autoaprendizaje utilizando 5000 TPU de primera generación para generar las partidas y 64 TPU de segunda generación para entrenar las redes neuronales , todo en paralelo , sin acceso a libros de aperturas ni tablas de finales . Después de cuatro horas de entrenamiento, DeepMind estimó que AlphaZero estaba jugando ajedrez con una calificación Elo más alta que Stockfish 8; después de nueve horas de entrenamiento, el algoritmo derrotó a Stockfish 8 en un torneo de 100 partidas con control de tiempo (28 victorias, 0 derrotas y 72 empates). [ 1 ] [ 2 ] [ 3 ] El algoritmo entrenado se ejecutó en una sola máquina con cuatro TPU.

El artículo de DeepMind sobre AlphaZero se publicó en la revista Science el 7 de diciembre de 2018. [ 4 ] Si bien el programa AlphaZero en sí no se ha hecho público, [ 5 ] el algoritmo descrito en el artículo se ha implementado en software disponible públicamente. En 2019, DeepMind publicó un nuevo artículo que detalla MuZero , un nuevo algoritmo capaz de generalizar el trabajo de AlphaZero, jugando tanto a juegos de Atari como a juegos de mesa sin conocer las reglas ni las representaciones del juego. [ 6 ]

Relación con AlphaGo Zero

AlphaZero (AZ) es una variante más generalizada del algoritmo AlphaGo Zero (AGZ) , y es capaz de jugar shogi y ajedrez además de Go . Las diferencias entre AZ y AGZ incluyen: [ 1 ]

  • AZ tiene reglas codificadas para configurar los hiperparámetros de búsqueda .
  • La red neuronal se actualiza continuamente.
  • A diferencia de AGZ, AZ no utiliza simetrías.
  • A diferencia del Go, el ajedrez o el shogi pueden terminar en empate ; por lo tanto, AlphaZero tiene en cuenta la posibilidad de una partida en tablas.

Stockfish y Elmo

Comparando las búsquedas en árbol de Monte Carlo , AlphaZero busca solo 80 000 posiciones por segundo en ajedrez y 40 000 en shogi, en comparación con los 70 millones de Stockfish y los 35 millones de Elmo. AlphaZero compensa el menor número de evaluaciones utilizando su red neuronal profunda para centrarse de forma mucho más selectiva en la variante más prometedora. [ 1 ]

Capacitación

AlphaZero se entrenó simplemente jugando contra sí mismo varias veces, utilizando 5.000 TPU de primera generación para generar los juegos y 64 TPU de segunda generación para entrenar las redes neuronales .

Paralelamente, el AlphaZero en entrenamiento se comparaba periódicamente con su modelo de referencia (Stockfish, Elmo o AlphaGo Zero) en breves partidas de un segundo por movimiento para determinar el progreso del entrenamiento. DeepMind estimó que el rendimiento de AlphaZero superaba al modelo de referencia tras aproximadamente cuatro horas de entrenamiento con Stockfish, dos horas con Elmo y ocho horas con AlphaGo Zero. [ 1 ]

Resultados preliminares

Resultado

Ajedrez

En la partida de ajedrez de AlphaZero contra Stockfish 8 ( campeón mundial TCEC 2016 ), cada programa tuvo un minuto por movimiento. AlphaZero ondeaba la bandera inglesa, mientras que Stockfish la noruega. [ 7 ] A Stockfish se le asignaron 64 hilos y un tamaño de hash de 1  GB, [ 1 ] una configuración que Tord Romstad de Stockfish criticó posteriormente como subóptima. [ 8 ] [ nota 1 ] AlphaZero fue entrenado en ajedrez durante un total de nueve horas antes de la partida. Durante la partida, AlphaZero se ejecutó en una sola máquina con cuatro TPU específicas para la aplicación . En 100 partidas desde la posición inicial normal, AlphaZero ganó 25 partidas con blancas, ganó 3 con negras y empató las 72 restantes. [ 9 ] En una serie de doce encuentros de 100 partidas (con limitaciones de tiempo o recursos no especificadas) contra Stockfish, comenzando desde las 12 aperturas humanas más populares, AlphaZero ganó 290, empató 886 y perdió 24. [ 1 ]

Shogi

AlphaZero fue entrenado en shogi durante un total de dos horas antes del torneo. En 100 partidas de shogi contra Elmo (versión del torneo del Campeonato Mundial de Shogi por Computadora 27, verano de 2017, con búsqueda YaneuraOu 4.73), AlphaZero ganó 90 veces, perdió 8 veces y empató dos veces. [ 9 ] Al igual que en las partidas de ajedrez, cada programa disponía de un minuto por movimiento, y a Elmo se le asignaron 64 hilos y un tamaño de hash de 1  GB. [ 1 ]

Ir

Después de 34 horas de autoaprendizaje de Go y contra AlphaGo Zero, AlphaZero ganó 60 partidas y perdió 40. [ 1 ] [ 9 ]

Análisis

DeepMind afirmó en su preimpresión: «El ajedrez representó la cúspide de la investigación en IA durante varias décadas. Los programas de vanguardia se basan en potentes motores que analizan millones de posiciones, aprovechando el conocimiento especializado del dominio y sofisticadas adaptaciones. AlphaZero es un algoritmo genérico de aprendizaje por refuerzo —originalmente diseñado para el juego de Go— que logró resultados superiores en pocas horas, analizando mil veces menos posiciones y sin ningún conocimiento del dominio, salvo las reglas». [ 1 ] Demis Hassabis , de DeepMind , jugador de ajedrez, calificó el estilo de juego de AlphaZero como «extraño»: «A veces gana ofreciendo sacrificios contraintuitivos, como sacrificar una dama y un alfil para explotar una ventaja posicional. Es como ajedrez de otra dimensión». [ 10 ]  

Dada la dificultad en ajedrez de forzar una victoria contra un oponente fuerte , el resultado +28 –0 =72 es un margen de victoria significativo. Sin embargo, algunos grandes maestros, como Hikaru Nakamura y el desarrollador de Komodo, Larry Kaufman , restaron importancia a la victoria de AlphaZero, argumentando que la partida habría sido más reñida si los programas hubieran tenido acceso a una base de datos de aperturas (ya que Stockfish estaba optimizado para ese escenario). [ 11 ] Romstad señaló además que Stockfish no está optimizado para movimientos con tiempo fijo y que la versión utilizada tenía un año de antigüedad. [ 8 ] [ 12 ]

De manera similar, algunos observadores del shogi argumentaron que el tamaño del hash de Elmo era demasiado bajo, que la configuración de renuncia y la configuración de "EnteringKingRule" (cf. shogi § Entering King ) podrían haber sido inapropiadas, y que Elmo ya está obsoleto en comparación con programas más nuevos. [ 13 ] [ 14 ]

Reacción y crítica

Los periódicos destacaron que el entrenamiento de ajedrez duró solo cuatro horas: "Se logró en poco más del tiempo entre el desayuno y el almuerzo". [ 2 ] [ 15 ] Wired describió a AlphaZero como "el primer campeón de juegos de mesa con IA multihabilidad". [ 16 ] La experta en IA Joanna Bryson señaló que el "talento de Google para la buena publicidad" lo colocaba en una posición fuerte frente a sus competidores. "No se trata solo de contratar a los mejores programadores. También es muy político, ya que ayuda a que Google sea lo más fuerte posible al negociar con gobiernos y reguladores que analizan el sector de la IA". [ 9 ]

Los grandes maestros de ajedrez humanos generalmente expresaron entusiasmo por AlphaZero. El gran maestro danés Peter Heine Nielsen comparó el juego de AlphaZero con el de una especie alienígena superior. [ 9 ] El gran maestro noruego Jon Ludvig Hammer caracterizó el juego de AlphaZero como un "ajedrez de ataque demencial" con una profunda comprensión posicional. [ 2 ] El excampeón Garry Kasparov dijo: "Es un logro extraordinario, aunque deberíamos haberlo esperado después de AlphaGo". [ 11 ] [ 17 ]

El Gran Maestro Hikaru Nakamura se mostró menos impresionado y declaró: "No le doy mucha credibilidad a los resultados simplemente porque entiendo que AlphaZero usa la supercomputadora de Google y Stockfish no funciona en ese hardware; Stockfish funcionaba en lo que sería mi computadora portátil. Si se quiere tener una partida comparable, Stockfish también debe funcionar en una supercomputadora". [ 8 ]

El destacado jugador estadounidense de ajedrez por correspondencia, Wolff Morrow, tampoco quedó impresionado, afirmando que AlphaZero probablemente no llegaría a las semifinales de una competición justa como la TCEC , donde todos los motores juegan con el mismo hardware. Morrow añadió que, si bien él podría no ser capaz de vencer a AlphaZero si este jugara aperturas que tienden a las tablas, como la Defensa Petroff , AlphaZero tampoco podría vencerlo en una partida de ajedrez por correspondencia . [ 18 ]

Motohiro Isozaki, autor de YaneuraOu, señaló que, si bien AlphaZero superó ampliamente a Elmo, su puntuación en shogi dejó de aumentar en un punto que, como máximo, es entre 100 y 200 puntos superior a la de Elmo. Esta diferencia no es tan grande, y Elmo y otros programas de shogi deberían poder alcanzarlo en 1 o 2 años. [ 19 ]

Resultados finales

DeepMind abordó muchas de las críticas en la versión final del artículo, publicada en diciembre de 2018 en Science . [ 4 ] Además, aclararon que AlphaZero no se ejecutaba en una supercomputadora; fue entrenado con 5000 unidades de procesamiento tensorial (TPU), pero solo se ejecutó en cuatro TPU y una CPU de 44 núcleos en sus partidas. [ 20 ]

Ajedrez

En los resultados finales, Stockfish 9 dev se ejecutó bajo las mismas condiciones que en la superfinal de TCEC : 44 núcleos de CPU, bases de datos de finales de Syzygy y un  tamaño de hash de 32 GB. En lugar de un control de tiempo fijo de un movimiento por minuto, ambos motores dispusieron de 3 horas más 15 segundos por movimiento para terminar la partida. AlphaZero se ejecutó en una máquina mucho más potente con cuatro TPU además de 44 núcleos de CPU. En un encuentro de 1000 partidas, AlphaZero ganó con un resultado de 155 victorias, 6 derrotas y 839 empates. DeepMind también jugó una serie de partidas utilizando las posiciones de apertura de TCEC; AlphaZero también ganó de forma convincente. Stockfish necesitó una ventaja de tiempo de 10 a 1 para igualar a AlphaZero. [ 21 ]

Shogi

Al igual que Stockfish, Elmo se ejecutó bajo las mismas condiciones que en el campeonato CSA de 2017. La versión de Elmo utilizada fue WCSC27 en combinación con YaneuraOu 2017 Early KPPT 4.79 64AVX2 TOURNAMENT. Elmo funcionó con el mismo hardware que Stockfish: 44 núcleos de CPU y un  tamaño de hash de 32 GB. AlphaZero ganó el 98,2 % de las partidas cuando jugaba sente (es decir, teniendo el primer movimiento) y el 91,2 % en general.

Reacciones y críticas

Los grandes maestros humanos quedaron generalmente impresionados con las partidas de AlphaZero contra Stockfish. [ 21 ] El excampeón mundial Garry Kasparov dijo que fue un placer ver jugar a AlphaZero, especialmente porque su estilo era abierto y dinámico como el suyo. [ 22 ] [ 23 ]

En la comunidad de ajedrez por computadora, el desarrollador de Komodo, Mark Lefler, lo calificó como un "logro bastante asombroso", pero también señaló que los datos eran antiguos, ya que Stockfish había ganado mucha fuerza desde enero de 2018 (cuando se lanzó Stockfish 8). El también desarrollador Larry Kaufman dijo que AlphaZero probablemente perdería una partida contra la última versión de Stockfish, Stockfish 10, bajo las condiciones del Campeonato de Motores de Ajedrez de Alto Rendimiento (TCEC). Kaufman argumentó que la única ventaja de los motores basados ​​en redes neuronales era que usaban una GPU, por lo que si no se tenía en cuenta el consumo de energía (por ejemplo, en una competencia con hardware igual donde ambos motores tenían acceso a la misma CPU y GPU), entonces todo lo que la GPU lograba era "gratis". Basándose en esto, afirmó que el motor más fuerte probablemente sería un híbrido con redes neuronales y búsqueda alfa-beta estándar . [ 24 ]

AlphaZero inspiró a la comunidad de ajedrez computacional a desarrollar Leela Chess Zero , utilizando las mismas técnicas que AlphaZero. Leela disputó varios campeonatos contra Stockfish, donde mostró una fuerza similar a la de Stockfish, aunque Stockfish se ha distanciado desde entonces. [ 25 ]

En 2019, DeepMind publicó MuZero , un sistema unificado que jugaba excelentemente al ajedrez, shogi y go, así como a juegos del Atari Learning Environment, sin estar preprogramado con sus reglas. [ 26 ] [ 27 ]

Véase también

Notas

  1. El desarrollador de Stockfish, Tord Romstad, respondió con
    Los resultados de la partida en sí mismos no son particularmente significativos debido a la extraña elección de controles de tiempo y configuración de parámetros de Stockfish: las partidas se jugaron a un tiempo fijo de 1 minuto/movimiento, lo que significa que Stockfish no utiliza sus heurísticas de gestión del tiempo (se ha invertido mucho esfuerzo en que Stockfish identifique los puntos críticos de la partida y decida cuándo dedicar tiempo extra a un movimiento; con un tiempo fijo por movimiento, la fuerza se verá significativamente afectada). La versión de Stockfish utilizada tiene un año de antigüedad, se ejecutaba con muchos más hilos de búsqueda de los que se habían sometido a pruebas significativas y tenía tablas hash demasiado pequeñas para el número de hilos. Creo que el porcentaje de empates habría sido mucho mayor en una partida con condiciones más normales. [ 8 ]

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 11 Silver, David ; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan; Graepel, Thore; Lillicrap, Timothy; Simonyan, Karen; Hassabis, Demis (5 de diciembre de 2017). "Dominando el ajedrez y el shogi mediante el autoaprendizaje con un algoritmo general de aprendizaje por refuerzo". arXiv : 1712.01815 [ cs.AI ].
  2. 1 2 3 Knapton, Sarah; Watson, Leon (6 de diciembre de 2017). "Todo el conocimiento humano sobre ajedrez aprendido y superado por AlphaZero de DeepMind en cuatro horas" . Telegraph.co.uk . Recuperado el 6 de diciembre de 2017 .
  3. Vincent, James (6 de diciembre de 2017). "La IA de DeepMind se convirtió en un jugador de ajedrez sobrehumano en pocas horas, solo por diversión" . The Verge . Consultado el 6 de diciembre de 2017 .
  4. 1 2 Silver, David ; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan; Graepel, Thore; Lillicrap, Timothy; Simonyan, Karen; Hassabis, Demis (7 de diciembre de 2018). "Un algoritmo general de aprendizaje por refuerzo que domina el ajedrez, el shogi y el juego por sí mismo" . Science . 362 (6419): 1140– 1144. Bibcode : 2018Sci...362.1140S . doi : 10.1126/science.aar6404 . PMID 30523106 . 
  5. "Términos de ajedrez: AlphaZero" . Chess.com . Consultado el 30 de julio de 2022 .
  6. Schrittwieser, Julián; Antonoglou, Ioannis; Hubert, Thomas; Simonyan, Karen; Sifré, Laurent; Schmitt, Simón; Guez, Arturo; Lockhart, Eduardo; Hassabis, Demis; Graepel, Thore; Lillicrap, Timoteo (2020). "Dominar Atari, Go, ajedrez y shogi planificando con un modelo aprendido". Naturaleza . 588 (7839): 604– 609. arXiv : 1911.08265 . Código Bib : 2020Natur.588..604S . doi : 10.1038/s41586-020-03051-4 . PMID 33361790 . S2CID 208158225 .  
  7. "AlphaZero vs. Stockfish 2017" .
  8. 1 2 3 4 "AlphaZero: Reacciones de los mejores GM, autor de Stockfish" . chess.com . 8 de diciembre de 2017. Consultado el 9 de diciembre de 2017 .
  9. 1 2 3 4 5 "La IA "sobrehumana" de Google se corona campeona del ajedrez . BBC News . 6 de diciembre de 2017. Consultado el 7 de diciembre de 2017 .
  10. Knight, Will (8 de diciembre de 2017). "El ajedrez 'Alien' de Alpha Zero demuestra el poder y la peculiaridad de la IA" . MIT Technology Review . Consultado el 11 de diciembre de 2017 .
  11. 1 2 "AlphaZero de Google destruye a Stockfish en un encuentro de 100 partidas" . Chess.com . Consultado el 7 de diciembre de 2017 .
  12. Katyanna Quach. "La IA AlphaZero de DeepMind derrotó a la aplicación de ajedrez rival en un tablero de juego desigual" . The Register (14 de diciembre de 2017).
  13. ^ "Algunas preocupaciones sobre las condiciones de coincidencia entre AlphaZero y el motor Shogi" .コンピュータ将棋 レーティング. "uuunuuun" (un blogger que califica motores de shogi gratuitos) . Consultado el 9 de diciembre de 2017 .(a través de "瀧澤 誠@elmo (@mktakizawa) | Twitter" . mktakizawa (desarrollador de elmo) . 9 de diciembre de 2017. Consultado el 11 de diciembre de 2017 .)
  14. ^ "DeepMind 社 が や ね う ら 王 に 注 目 し 始 め た よ う で す" . El desarrollador de YaneuraOu, un componente de búsqueda utilizado por elmo. 7 de diciembre de 2017 . Consultado el 9 de diciembre de 2017 .
  15. Badshah, Nadeem (7 de diciembre de 2017). "El robot DeepMind de Google se convierte en un gran maestro de ajedrez que vence al mundo en cuatro horas" . The Times of London . Consultado el 7 de diciembre de 2017 .
  16. "El último poni de exhibición con IA de Alphabet tiene más de un truco" . WIRED . 6 de diciembre de 2017. Consultado el 7 de diciembre de 2017 .
  17. Gibbs, Samuel (7 de diciembre de 2017). "AlphaZero AI vence al programa campeón de ajedrez tras aprender por sí mismo en cuatro horas" . The Guardian . Consultado el 8 de diciembre de 2017 .
  18. "Hablando de ajedrez moderno por correspondencia" . Chessbase. 26 de junio de 2018. Consultado el 11 de julio de 2018 .
  19. DeepMind社がやねうら王に注目し始めたようです | やねうら王 公式サイト, 2017年12月7日
  20. Como se indica en el artículo de Science , una TPU es "aproximadamente similar en velocidad de inferencia a una GPU Titan V, aunque las arquitecturas no son directamente comparables" (Ref. 24).
  21. 1 2 "AlphaZero aplasta a Stockfish en una nueva partida de 1000 juegos" . 6 de diciembre de 2018.
  22. Sean Ingle (11 de diciembre de 2018) .La "creativa" AlphaZero abre el camino a las computadoras de ajedrez y, tal vez, a la ciencia . The Guardian .
  23. Albert Silver (7 de diciembre de 2018). "Dentro de la mente (profunda) de AlphaZero" . Chessbase.
  24. "Komodo MCTS (Monte Carlo Tree Search) es la nueva estrella de TCEC" . Chessdom. 18 de diciembre de 2018.
  25. Ver TCEC y Leela Chess Zero .
  26. "¿Podría la inteligencia artificial salvarnos de sí misma?" . Fortune . 2019 . Consultado el 29 de febrero de 2020 .
  27. "MuZero de DeepMind aprende por sí mismo a ganar en Atari, ajedrez, shogi y Go" . VentureBeat . 20 de noviembre de 2019. Consultado el 29 de febrero de 2020 .
  • Wiki de programación de ajedrez en AlphaZero
  • Lista de reproducción de Chess.com en YouTube para AlphaZero vs. Stockfish