AlphaGo Zero es una versión del software de Go AlphaGo de DeepMind . El equipo de AlphaGo publicó un artículo en Nature en octubre de 2017 presentando AlphaGo Zero, una versión creada sin usar datos de partidas humanas y más fuerte que cualquier versión anterior. [ 1 ] Jugando partidas contra sí mismo, AlphaGo Zero: superó la fuerza de AlphaGo Lee en tres días ganando 100 partidas a 0; alcanzó el nivel de AlphaGo Master en 21 días; y superó a todas las versiones anteriores en 40 días. [ 2 ]
Entrenar inteligencia artificial (IA) sin conjuntos de datos derivados de expertos humanos tiene implicaciones significativas para el desarrollo de IA con habilidades sobrehumanas, ya que los datos de expertos "suelen ser caros, poco fiables o simplemente no están disponibles". [ 3 ] Demis Hassabis , cofundador y director ejecutivo de DeepMind, afirmó que AlphaGo Zero era tan potente porque "ya no estaba limitado por las limitaciones del conocimiento humano". [ 4 ] Además, AlphaGo Zero tuvo un mejor rendimiento que los modelos estándar de aprendizaje por refuerzo profundo (como las implementaciones de Deep Q-Network [ 5 ] ) debido a su integración de la búsqueda en árbol de Monte Carlo . David Silver , uno de los primeros autores de los artículos de DeepMind publicados en Nature sobre AlphaGo, afirmó que es posible tener algoritmos de IA generalizados eliminando la necesidad de aprender de los humanos. [ 6 ]
Google desarrolló posteriormente AlphaZero , una versión generalizada de AlphaGo Zero que podía jugar ajedrez y shōgi además de Go. [ 7 ] En diciembre de 2017, AlphaZero venció a la versión de 3 días de AlphaGo Zero ganando 60 partidas a 40, y con 8 horas de entrenamiento superó a AlphaGo Lee en la escala Elo . AlphaZero también derrotó a un programa de ajedrez de alto nivel ( Stockfish ) y a un programa de shōgi de alto nivel ( Elmo ). [ 8 ] [ 9 ]
Arquitectura
La red en AlphaGo Zero es una ResNet con dos cabezas. [ 1 ] : Apéndice: Métodos
- El núcleo de la red toma como entrada una representación tensorial de 17x19x19 del tablero de Go.
- Los 8 canales representan las posiciones de las fichas del jugador actual en los últimos ocho pasos de tiempo. (1 si hay una ficha, 0 en caso contrario. Si el paso de tiempo es anterior al inicio del juego, entonces 0 en todas las posiciones).
- Los 8 canales representan las posiciones de las fichas del otro jugador en los últimos ocho pasos de tiempo.
- Un canal es todo 1 si las negras deben moverse, y 0 en caso contrario.
- El cuerpo es una ResNet con 20 o 40 bloques residuales y 256 canales.
- Hay dos secciones: una sección de políticas y una sección de valores.
- El encabezado de la política genera una matriz logit de tamaño, que representa el logit de realizar un movimiento en uno de los puntos, más el logit de pasar .
- El cabezal de valor genera un número en el rango, que representa la puntuación esperada para el jugador actual. -1 representa que el jugador actual pierde y +1 gana.
Capacitación
La red neuronal de AlphaGo Zero se entrenó utilizando TensorFlow , con 64 trabajadores de GPU y 19 servidores de parámetros de CPU. Solo se utilizaron cuatro TPU para la inferencia. Inicialmente, la red neuronal no sabía nada sobre Go más allá de las reglas . A diferencia de las versiones anteriores de AlphaGo, Zero solo percibía las piedras del tablero, en lugar de tener algunos casos límite raros programados por humanos para ayudar a reconocer posiciones inusuales del tablero de Go. La IA empleó el aprendizaje por refuerzo , jugando contra sí misma hasta que pudo anticipar sus propios movimientos y cómo esos movimientos afectarían el resultado de la partida. [ 10 ] En los primeros tres días, AlphaGo Zero jugó 4,9 millones de partidas contra sí misma en rápida sucesión. [ 11 ] Parecía desarrollar las habilidades necesarias para vencer a los mejores humanos en tan solo unos días, mientras que el AlphaGo anterior requirió meses de entrenamiento para alcanzar el mismo nivel. [ 12 ]
Según Epoch.ai, el entrenamiento costó 3e23 FLOPs. [ 13 ]
Para comparar, los investigadores también entrenaron una versión de AlphaGo Zero usando juegos humanos, AlphaGo Master, y descubrieron que aprendía más rápido, pero en realidad tenía un rendimiento peor a largo plazo. [ 14 ] DeepMind presentó sus hallazgos iniciales en un artículo a Nature en abril de 2017, que luego se publicó en octubre de 2017. [ 1 ]
Costo del hardware
El costo del hardware para un solo sistema AlphaGo Zero en 2017, incluyendo las cuatro TPU, se ha citado en alrededor de $25 millones. [ 15 ]
Aplicaciones
Según Hassabis, los algoritmos de AlphaGo probablemente sean más beneficiosos para dominios que requieren una búsqueda inteligente a través de un enorme espacio de posibilidades, como el plegamiento de proteínas (véase AlphaFold ) o la simulación precisa de reacciones químicas. [ 16 ] Las técnicas de AlphaGo probablemente sean menos útiles en dominios difíciles de simular, como aprender a conducir un automóvil. [ 17 ] DeepMind declaró en octubre de 2017 que ya había comenzado a trabajar activamente en el intento de utilizar la tecnología AlphaGo Zero para el plegamiento de proteínas, y afirmó que pronto publicaría nuevos hallazgos. [ 18 ] [ 19 ]
Recepción
AlphaGo Zero fue ampliamente considerado un avance significativo, incluso en comparación con su revolucionario predecesor, AlphaGo. Oren Etzioni del Instituto Allen para la Inteligencia Artificial calificó a AlphaGo Zero como "un resultado técnico muy impresionante" tanto por "su capacidad para lograrlo como por su capacidad para entrenar el sistema en 40 días, en cuatro TPU". [ 10 ] The Guardian lo calificó como un "gran avance para la inteligencia artificial", citando a Eleni Vasilaki de la Universidad de Sheffield y a Tom Mitchell de la Universidad Carnegie Mellon , quienes lo calificaron como una hazaña impresionante y un "logro de ingeniería sobresaliente", respectivamente. [ 17 ] Mark Pesce de la Universidad de Sídney calificó a AlphaGo Zero como "un gran avance tecnológico" que nos lleva a "territorio inexplorado". [ 20 ]
Gary Marcus , psicólogo de la Universidad de Nueva York , advirtió que, por lo que sabemos, AlphaGo podría contener "conocimiento implícito que los programadores tienen sobre cómo construir máquinas para resolver problemas como el Go" y que será necesario probarlo en otros ámbitos antes de poder asegurar que su arquitectura base sea eficaz para mucho más que jugar al Go. En cambio, DeepMind "confía en que este enfoque es generalizable a un gran número de ámbitos". [ 11 ]
En respuesta a los informes, el profesional surcoreano de Go, Lee Sedol, declaró: "La versión anterior de AlphaGo no era perfecta, y creo que por eso se creó AlphaGo Zero". Sobre el potencial de desarrollo de AlphaGo, Lee comentó que tendrá que esperar y ver, pero también afirmó que influirá en los jóvenes jugadores de Go. Mok Jin-seok , director del equipo nacional surcoreano de Go, afirmó que el mundo del Go ya ha estado imitando los estilos de juego de versiones anteriores de AlphaGo y creando nuevas ideas a partir de ellas, y confía en que AlphaGo Zero también aportará nuevas ideas. Mok añadió que las tendencias generales en el mundo del Go están siendo influenciadas por el estilo de juego de AlphaGo. "Al principio, era difícil de entender y casi sentía que jugaba contra un extraterrestre. Sin embargo, con la experiencia, me he acostumbrado", dijo Mok. "Ya hemos superado la etapa en la que debatíamos la diferencia entre la capacidad de AlphaGo y la de los humanos. Ahora la cuestión está entre las computadoras". Según se informa, Mok ya ha comenzado a analizar el estilo de juego de AlphaGo Zero junto con jugadores del equipo nacional. «Aunque solo hemos visto unas pocas partidas, nos dio la impresión de que AlphaGo Zero juega más como un humano que sus predecesores», dijo Mok. [ 21 ] El profesional chino de Go, Ke Jie, comentó sobre los notables logros del nuevo programa: «Un AlphaGo de autoaprendizaje puro es el más fuerte. Los humanos parecen superfluos frente a su capacidad de auto-mejora». [ 22 ]
Comparación con predecesores
AlphaZero
On 5 December 2017, DeepMind team released a preprint on arXiv, introducing AlphaZero, a program using generalized AlphaGo Zero's approach, which achieved within 24 hours a superhuman level of play in chess, shogi, and Go, defeating world-champion programs, Stockfish, Elmo, and 3-day version of AlphaGo Zero in each case.[8]
AlphaZero (AZ) is a more generalized variant of the AlphaGo Zero (AGZ) algorithm, and is able to play shogi and chess as well as Go. Differences between AZ and AGZ include:[8]
- AZ has hard-coded rules for setting search hyperparameters.
- The neural network is now updated continually.
- Chess (unlike Go) can end in a tie; therefore AZ can take into account the possibility of a tie game.
An open source program, Leela Zero, based on the ideas from the AlphaGo papers is available. It uses a GPU instead of the TPUs recent versions of AlphaGo rely on.
References
- 1234567Silver, David; Schrittwieser, Julian; Simonyan, Karen; Antonoglou, Ioannis; Huang, Aja; Guez, Arthur; Hubert, Thomas; Baker, Lucas; Lai, Matthew; Bolton, Adrian; Chen, Yutian; Lillicrap, Timothy; Fan, Hui; Sifre, Laurent; Driessche, George van den; Graepel, Thore; Hassabis, Demis (19 October 2017). "Mastering the game of Go without human knowledge"(PDF). Nature. 550 (7676): 354–359. Bibcode:2017Natur.550..354S. doi:10.1038/nature24270. ISSN 0028-0836. PMID 29052630. S2CID 205261034. Archived(PDF) from the original on 18 July 2018. Retrieved 2 September 2019.

- 12345Hassabis, Demis; Siver, David (18 October 2017). "AlphaGo Zero: Learning from scratch". DeepMind official website. Archived from the original on 19 October 2017. Retrieved 19 October 2017.
- ↑ "El nuevo avance de AlphaGo de Google podría llevar a los algoritmos a lugares inexplorados por los humanos" . Yahoo! Finanzas . 19 de octubre de 2017. Archivado del original el 19 de octubre de 2017. Consultado el 19 de octubre de 2017 .
- ↑ Knapton, Sarah (18 de octubre de 2017). «AlphaGo Zero: la supercomputadora DeepMind de Google aprende 3000 años de conocimiento humano en 40 días» . The Telegraph . Archivado del original el 19 de octubre de 2017. Consultado el 19 de octubre de 2017 .
- ↑ mnj12 (7 de julio de 2021), mnj12/chessDeepLearning , consultado el 7 de julio de 2021
{{citation}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "DeepMind AlphaGo Zero aprende por sí solo sin intervención humana" . ZDNet . 19 de octubre de 2017. Archivado del original el 20 de octubre de 2017. Consultado el 20 de octubre de 2017 .
- ↑ Silver, David; Hubert, Thomas; Schrittwieser, Julian (2017). "Dominando el ajedrez y el shogi mediante el autoaprendizaje con un algoritmo general de aprendizaje por refuerzo" (PDF) . Recuperado el 4 de agosto de 2025 .
- 1 2 3 4 5 Silver, David ; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan ; Graepel, Thore; Lillicrap, Timothy; Simonyan, Karen; Hassabis, Demis (5 de diciembre de 2017). "Dominando el ajedrez y el shogi mediante el autoaprendizaje con un algoritmo general de aprendizaje por refuerzo". arXiv : 1712.01815 [ cs.AI ].
- ↑ Knapton, Sarah; Watson, Leon (6 de diciembre de 2017). "Todo el conocimiento humano sobre ajedrez aprendido y superado por AlphaZero de DeepMind en cuatro horas" . The Telegraph . Archivado del original el 2 de diciembre de 2020. Recuperado el 5 de abril de 2018 .
- 1 2 Greenemeier, Larry. "IA contra IA: AlphaGo Zero, autodidacta, vence a su predecesor" . Scientific American . Archivado del original el 19 de octubre de 2017. Recuperado el 20 de octubre de 2017 .
- 1 2 "Una computadora aprende a jugar Go a niveles sobrehumanos 'sin conocimiento humano'"" . NPR . 18 de octubre de 2017. Archivado del original el 20 de octubre de 2017 . Consultado el 20 de octubre de 2017 .
- ↑ "El nuevo avance de AlphaGo de Google podría llevar a los algoritmos a lugares inexplorados por los humanos" . Fortune . 19 de octubre de 2017. Archivado del original el 19 de octubre de 2017. Consultado el 20 de octubre de 2017 .
- ↑ "Datos sobre modelos de IA destacados" . Epoch AI . 19 de junio de 2024. Consultado el 29 de noviembre de 2024 .
- ↑ "Este programa informático puede vencer a los humanos en Go, sin ninguna instrucción humana" . Ciencia | AAAS . 18 de octubre de 2017. Archivado del original el 2 de febrero de 2022. Consultado el 20 de octubre de 2017 .
- ↑ Gibney, Elizabeth (18 de octubre de 2017). "La IA autodidacta es la mejor hasta ahora en el juego de estrategia Go" . Nature News . doi : 10.1038/nature.2017.22858 . Archivado del original el 1 de mayo de 2020. Recuperado el 10 de mayo de 2020 .
- ↑ "La IA más reciente puede resolver problemas sin necesidad de entrenamiento" . The Economist . Archivado del original el 19 de octubre de 2017. Consultado el 20 de octubre de 2017 .
- 1 2 Sample, Ian (18 de octubre de 2017) .«Es capaz de crear conocimiento por sí misma»: Google presenta una IA que aprende de forma autónoma . The Guardian . Archivado del original el 19 de octubre de 2017. Consultado el 20 de octubre de 2017 .
- ↑ "«Es capaz de crear conocimiento por sí misma»: Google presenta una IA que aprende de forma autónoma . The Guardian . 18 de octubre de 2017. Archivado del original el 19 de octubre de 2017. Consultado el 26 de diciembre de 2017 .
- ↑ Knapton, Sarah (18 de octubre de 2017). «AlphaGo Zero: la supercomputadora DeepMind de Google aprende 3000 años de conocimiento humano en 40 días» . The Telegraph . Archivado del original el 15 de diciembre de 2017. Consultado el 26 de diciembre de 2017 .
- ↑ "Cómo la nueva IA de Google puede aprender a ganarte en los juegos más complejos" . Australian Broadcasting Corporation . 19 de octubre de 2017. Archivado del original el 20 de octubre de 2017. Consultado el 20 de octubre de 2017 .
- ↑ "Jugadores de Go entusiasmados con AlphaGo Zero, 'más parecido al humano'" . Korea Bizwire . 19 de octubre de 2017. Archivado del original el 21 de octubre de 2017. Consultado el 21 de octubre de 2017 .
- ↑ "Nueva versión de AlphaGo puede dominar Weiqi sin ayuda humana" . Servicio de Noticias de China . 19 de octubre de 2017. Archivado del original el 19 de octubre de 2017. Consultado el 21 de octubre de 2017 .
- ^ "【柯洁战败解密】AlphaGo Master最新架构和算法,谷歌云与TPU拆解" (en chino). Sohu . 24 de mayo de 2017. Archivado desde el original el 17 de septiembre de 2017 . Consultado el 1 de junio de 2017 .
- ↑ El hardware utilizado durante el entrenamiento puede ser sustancialmente más potente.
Enlaces externos y lecturas adicionales
- "AlphaGo Zero: Empezando desde cero" . Archivado del original el 3 de enero de 2020.
- Singh, S.; Okun, A.; Jackson, A. (2017). "AOP" . Nature . 550 (7676): 336– 337. Bibcode : 2017Natur.550..336S . doi : 10.1038 /550336a . PMID 29052631. S2CID 4447445 .
- Silver, David; Schrittwieser, Julian; Simonyan, Karen; Antonoglou, Ioannis; Huang, Aja; Guez, Arthur; Hubert, Thomas; Baker, Lucas; Lai, Matthew; Bolton, Adrian; Chen, Yutian; Lillicrap, Timothy; Hui, Fan; Sifre, Laurent; Van Den Driessche, George; Graepel, Thore; Hassabis, Demis (2017). "Dominando el juego de Go sin conocimiento humano" ( PDF) . Nature . 550 (7676): 354– 359. Bibcode : 2017Natur.550..354S . doi : 10.1038/nature24270 . PMID 29052630. S2CID 205261034 .
- Juegos AlphaGo Zero
- Software de 2017
- Aprendizaje automático aplicado
- AlphaGo
- 2017 en marcha