Articulo de referencia

OpenAI Cinco

OpenAI Five es un programa informático de OpenAI que juega al videojuego Dota 2, un juego de cinco contra cinco . Su primera aparición pública tuvo lugar en 2017, cuando se demo...

OpenAI Five es un programa informático de OpenAI que juega al videojuego Dota 2, un juego de cinco contra cinco . Su primera aparición pública tuvo lugar en 2017, cuando se demostró en una partida en directo uno contra uno contra el jugador profesional Dendi , quien perdió. Al año siguiente, el sistema había avanzado hasta el punto de funcionar como un equipo completo de cinco jugadores y comenzó a jugar contra equipos profesionales, demostrando su capacidad para derrotarlos.

Al elegir un juego tan complejo como Dota 2 para estudiar el aprendizaje automático , OpenAI pensó que podría capturar con mayor precisión la imprevisibilidad y la continuidad que se observan en el mundo real, construyendo así sistemas de resolución de problemas más generales. Los algoritmos y el código utilizados por OpenAI Five fueron posteriormente adoptados por otra red neuronal en desarrollo por la compañía, que controlaba una mano robótica física. OpenAI Five se ha comparado con otros casos similares de inteligencia artificial (IA) que compiten contra humanos y los derrotan, como AlphaStar en el videojuego StarCraft II , AlphaGo en el juego de mesa Go , Deep Blue en ajedrez y Watson en el programa de televisión Jeopardy !.

Historia

El desarrollo de los algoritmos utilizados para los bots comenzó en noviembre de 2016. OpenAI decidió usar Dota 2 , un videojuego competitivo de cinco contra cinco, como base debido a su popularidad en la plataforma de transmisión en vivo Twitch , su soporte nativo para Linux y la disponibilidad de una interfaz de programación de aplicaciones (API). [ 1 ] Antes de convertirse en un equipo de cinco, la primera demostración pública tuvo lugar en The International 2017 en agosto, el torneo anual de campeonato principal del juego, donde Dendi , un jugador profesional ucraniano, perdió contra un bot de OpenAI en un enfrentamiento en vivo uno contra uno. [ 2 ] [ 3 ] Después del partido, el CTO Greg Brockman explicó que el bot había aprendido jugando contra sí mismo durante dos semanas en tiempo real , y que el software de aprendizaje era un paso en la dirección de crear software que pueda manejar tareas complejas "como ser un cirujano". [ 4 ] [ 5 ] OpenAI utilizó una metodología llamada aprendizaje por refuerzo , ya que los bots aprenden con el tiempo jugando contra sí mismos cientos de veces al día durante meses, en los que son recompensados ​​por acciones como matar a un enemigo y destruir torres. [ 6 ] [ 7 ] [ 8 ]

Para junio de 2018, la capacidad de los bots se expandió para jugar juntos como un equipo completo de cinco y pudieron derrotar a equipos de jugadores aficionados y semiprofesionales. [ 9 ] [ 6 ] [ 10 ] [ 11 ] En The International 2018 , OpenAI Five jugó en dos juegos contra equipos profesionales, uno contra el equipo brasileño paiN Gaming y el otro contra un equipo estelar de exjugadores chinos. [ 12 ] [ 13 ] [ 14 ] Aunque los bots perdieron ambos partidos, OpenAI aún lo consideró una iniciativa exitosa, afirmando que jugar contra algunos de los mejores jugadores de Dota 2 les permitió analizar y ajustar sus algoritmos para juegos futuros. [ 15 ] La demostración pública final de los bots tuvo lugar en abril de 2019, donde ganaron una serie al mejor de tres contra los campeones de The International 2018, OG, en un evento en vivo en San Francisco . [ 16 ] Un evento en línea de cuatro días para jugar contra los bots, abierto al público, tuvo lugar el mismo mes. [ 17 ] Allí, los bots jugaron en 42 729 partidas públicas, ganando el 99,4 % de esas partidas. [ 18 ]

Arquitectura

Cada bot de OpenAI Five es una red neuronal que contiene una sola capa con una LSTM de 4096 unidades [ 19 ] que observa el estado actual del juego extraído de la API del desarrollador de Dota. La red neuronal realiza acciones a través de numerosas cabezas de acción posibles (sin datos humanos involucrados), y cada cabeza tiene un significado. Por ejemplo, el número de ticks para retrasar una acción, qué acción seleccionar: la coordenada X o Y de esta acción en una cuadrícula alrededor de la unidad. Además, las cabezas de acción se calculan de forma independiente. El sistema de IA observa el mundo como una lista de 20 000 números y toma una acción mediante una lista de ocho valores de enumeración. También selecciona diferentes acciones y objetivos para comprender cómo codificar cada acción y observar el mundo. [ 20 ]

OpenAI Five se ha desarrollado como un sistema de entrenamiento de aprendizaje por refuerzo de propósito general en la infraestructura "Rapid". Rapid consta de dos capas: una pone en marcha miles de máquinas y les ayuda a "comunicarse" entre sí, y una segunda capa ejecuta software. Para 2018, OpenAI Five había jugado aproximadamente 180 años de juegos en aprendizaje por refuerzo ejecutándose en 256 GPU y 128 000 núcleos de CPU , [ 21 ] utilizando Optimización de Política Proximal , un método de gradiente de política . [ 20 ] [ 22 ]

Comparaciones con otros sistemas de IA para juegos

Antes de OpenAI Five, otros experimentos y sistemas de IA contra humanos se habían utilizado con éxito, como Jeopardy! con Watson , ajedrez con Deep Blue y Go con AlphaGo . [ 23 ] [ 24 ] [ 25 ] En comparación con otros juegos que han utilizado sistemas de IA para jugar contra jugadores humanos, Dota 2 difiere como se explica a continuación: [ 20 ]

A largo plazo : Los bots funcionan a 30 fotogramas por segundo durante una partida promedio de 45 minutos, lo que genera 80 000 ticks por juego. OpenAI Five observa cada cuatro fotogramas, generando 20 000 movimientos. En comparación, el ajedrez suele terminar antes de los 40 movimientos, mientras que el Go termina antes de los 150.

Estado del juego parcialmente observado : Los jugadores y sus aliados solo pueden ver el mapa que los rodea directamente. El resto está cubierto por una niebla de guerra que oculta las unidades enemigas y sus movimientos. Por lo tanto, jugar Dota 2 requiere hacer inferencias basadas en estos datos incompletos, así como predecir lo que el oponente podría estar haciendo al mismo tiempo. En comparación, el ajedrez y el go son "juegos de información completa", ya que no ocultan elementos al jugador contrario. [ 26 ]

Espacio de acción continuo : Cada personaje jugable en una partida de Dota 2 , conocido como héroe, puede realizar docenas de acciones dirigidas a otra unidad o a una posición. Los desarrolladores de OpenAI Five permiten hasta 170 000 acciones posibles por héroe. Sin contar los aspectos perpetuos del juego, hay un promedio de aproximadamente 1000 acciones válidas por ciclo. En comparación, el número promedio de acciones en ajedrez es de 35 y en Go de 250.

Espacio de observación continua : Dota 2 se juega en un mapa grande con diez héroes, cinco por equipo, además de decenas de edificios y personajes no jugadores (NPC). El sistema OpenAI observa el estado del juego a través de la API del bot para desarrolladores, que contiene 20 000 números que constituyen toda la información a la que un humano tiene acceso. Un tablero de ajedrez se representa con aproximadamente 70 listas, mientras que un tablero de Go tiene alrededor de 400 enumeraciones.

Recepción

OpenAI Five ha recibido el reconocimiento de la comunidad de IA, tecnología y videojuegos en general. El fundador de Microsoft , Bill Gates, lo calificó de "gran logro", ya que sus victorias "requirieron trabajo en equipo y colaboración". [ 8 ] [ 27 ] El campeón de ajedrez Garry Kasparov , quien perdió contra la IA Deep Blue en 1997, afirmó que, a pesar de su desempeño perdedor en The International 2018, los bots eventualmente "lo lograrían, y antes de lo esperado". [ 28 ]

En una conversación con MIT Technology Review , los expertos en IA también consideraron el sistema OpenAI Five como un logro significativo, ya que señalaron que Dota 2 era un "juego extremadamente complicado", por lo que incluso vencer a jugadores no profesionales era impresionante. [ 26 ] PC Gamer escribió que sus victorias contra jugadores profesionales fueron un evento significativo en el aprendizaje automático. [ 29 ] Por el contrario, Motherboard escribió que la victoria fue "básicamente trampa" debido a los conjuntos de héroes simplificados en ambos lados, así como al hecho de que los bots tuvieron acceso directo a la API, en lugar de usar visión artificial para interpretar los píxeles en la pantalla. [ 30 ] The Verge escribió que los bots eran evidencia de que el enfoque de la compañía hacia el aprendizaje por refuerzo y su filosofía general sobre IA estaba "produciendo hitos". [ 17 ]

En 2019, DeepMind presentó un bot similar para StarCraft II , AlphaStar . Al igual que OpenAI Five, AlphaStar utilizaba aprendizaje por refuerzo y autoaprendizaje. The Verge informó que «el objetivo de este tipo de investigación en IA no es simplemente derrotar a los humanos en diversos juegos para demostrar que es posible. En cambio, se trata de demostrar que, con suficiente tiempo, esfuerzo y recursos, un software de IA sofisticado puede superar a los humanos en prácticamente cualquier desafío cognitivo competitivo, ya sea un juego de mesa o un videojuego moderno». Añadieron que las victorias de DeepMind y OpenAI también eran una prueba del poder de ciertos usos del aprendizaje por refuerzo. [ 31 ]

OpenAI esperaba que la tecnología tuviera aplicaciones fuera del ámbito digital. En 2018, lograron reutilizar los mismos algoritmos de aprendizaje por refuerzo y el código de entrenamiento de OpenAI Five para Dactyl , una mano robótica con apariencia humana y una red neuronal diseñada para manipular objetos físicos. [ 32 ] En 2019, Dactyl resolvió el cubo de Rubik . [ 33 ]

Referencias

  1. OpenAI. "OpenAI Five" . openai.com/five . Archivado del original el 1 de septiembre de 2018. Consultado el 10 de octubre de 2018 .
  2. Savov, Vlad (14 de agosto de 2017). "Mi juego favorito ha sido invadido por bots de IA asesinos y la exageración de Elon Musk" . The Verge . Archivado del original el 26 de junio de 2018. Recuperado el 25 de junio de 2018 .
  3. Frank, Blair Hanley. "El bot de OpenAI derrota tan fácilmente al mejor jugador de Dota 2 que lo obliga a abandonar" . Venture Beat . Archivado del original el 12 de agosto de 2017. Consultado el 12 de agosto de 2017 .
  4. OpenAI (11 de agosto de 2017). "Dota 2" . blog.openai.com . Archivado del original el 11 de agosto de 2017. Consultado el 12 de agosto de 2017 .
  5. OpenAI (16 de agosto de 2017). "Más sobre Dota 2" . blog.openai.com . Archivado del original el 16 de agosto de 2017. Consultado el 16 de agosto de 2017 .
  6. 1 2 Simonite, Tom (25 de junio de 2018). "¿Pueden los bots superar a los humanos en uno de los juegos de eSports más importantes?" . Wired . Archivado del original el 25 de junio de 2018 . Recuperado el 25 de junio de 2018 .
  7. Kahn, Jeremy (25 de junio de 2018). "Un bot respaldado por Elon Musk ha logrado un avance en IA en el mundo de los videojuegos" . Bloomberg.com . Archivado del original el 27 de junio de 2018. Consultado el 27 de junio de 2018 .
  8. 1 2 "Bill Gates dice que los bots de videojuegos de la organización sin fines de lucro respaldada por Elon Musk son un 'hito enorme' en la IA" CNBC . 28 de junio de 2018. Archivado del original el 28 de junio de 2018. Recuperado el 28 de junio de 2018 .
  9. OpenAI (18 de julio de 2018). "OpenAI Five Benchmark" . blog.openai.com . Archivado del original el 26 de agosto de 2018. Consultado el 25 de agosto de 2018 .
  10. Vincent, James (25 de junio de 2018). "Bots de IA entrenados durante 180 años al día para vencer a humanos en Dota 2" . The Verge . Archivado del original el 25 de junio de 2018. Recuperado el 25 de junio de 2018 .
  11. Savov, Vlad (6 de agosto de 2018). "Los bots de OpenAI Dota 2 acaban de derrotar a un equipo de exprofesionales" . The Verge . Archivado del original el 7 de agosto de 2018. Recuperado el 7 de agosto de 2018 .
  12. Hutson, Matthew (31 de julio de 2019). "Con tan solo unos meses de vida, una IA que juega videojuegos conquista el mundo" . Medium . Recuperado el 12 de junio de 2025 .
  13. Simonite, Tom. "Los jugadores profesionales se defienden de los bots de IA respaldados por Elon Musk, por ahora" . Wired . Archivado del original el 24 de agosto de 2018. Consultado el 25 de agosto de 2018 .
  14. Quach, Katyanna. "Se acabó el juego, máquinas: los humanos derrotan una vez más a los bots de OpenAI en las Olimpiadas de videojuegos" . The Register . Archivado del original el 25 de agosto de 2018. Consultado el 25 de agosto de 2018 .
  15. OpenAI (24 de agosto de 2018). "The International 2018: Resultados" . blog.openai.com . Archivado del original el 24 de agosto de 2018. Consultado el 25 de agosto de 2018 .
  16. Wiggers, Kyle (13 de abril de 2019). "OpenAI Five derrota dos veces a un equipo profesional de Dota 2" . Venture Beat . Archivado del original el 13 de abril de 2019. Recuperado el 13 de abril de 2019 .
  17. 1 2 Statt, Nick (13 de abril de 2019). "La IA de Dota 2 de OpenAI arrasa con el equipo campeón mundial de e-sports con victorias consecutivas" . The Verge . Vox Media. Archivado del original el 15 de abril de 2019. Recuperado el 15 de abril de 2019 .
  18. Wiggers, Kyle (22 de abril de 2019). "El bot de Dota 2 de OpenAI derrotó al 99,4% de los jugadores en partidas públicas" . Venture Beat . Archivado del original el 11 de julio de 2019. Consultado el 22 de abril de 2019 .
  19. "Dota 2 con aprendizaje profundo por refuerzo a gran escala" (PDF) . OpenAI . Archivado (PDF) del original el 26 de septiembre de 2024. Recuperado el 29 de septiembre de 2024 .
  20. 1 2 3 OpenAI (25 de junio de 2018). "OpenAI Five" . blog.openai.com . Archivado del original el 25 de junio de 2018. Recuperado el 25 de junio de 2018 .
  21. "¿Por qué los investigadores de IA están tan obsesionados con los juegos?" . QUARTZ . 4 de agosto de 2018. Archivado del original el 4 de agosto de 2018. Recuperado el 4 de agosto de 2018 .
  22. Schulman, John; Wolski, Filip; Dhariwal, Prafulla; Radford, Alec; Klimov, Oleg (2017). "Algoritmos de optimización de políticas proximales". arXiv : 1707.06347 [ cs.LG ].
  23. Gabbatt, Adam (17 de febrero de 2011). "La computadora Watson de IBM gana el enfrentamiento de Jeopardy" . The Guardian . Archivado del original el 21 de septiembre de 2013. Recuperado el 17 de febrero de 2011 .
  24. "El gran maestro de ajedrez Garry Kasparov habla sobre lo que sucede cuando las máquinas 'alcanzan un nivel en el que es imposible que los humanos compitan'"." . Business Insider . Archivado del original el 29 de diciembre de 2017 . Consultado el 29 de diciembre de 2017 .
  25. "La IA de DeepMind que juega al Go ya no necesita ayuda humana para vencernos" . Verge . 18 de octubre de 2017. Archivado del original el 18 de octubre de 2017. Consultado el 18 de octubre de 2017 .
  26. 1 2 Knight, Will (25 de junio de 2018). "Un equipo de algoritmos de IA acaba de derrotar a los humanos en un complejo juego de computadora" . MIT Tech Review . Recuperado el 25 de junio de 2018 .
  27. "Bill Gates celebra un 'hito importantísimo' para la IA, ya que los bots trabajan en equipo para destruir a los humanos en el videojuego 'Dota 2'"." . Business Insider . Archivado del original el 27 de junio de 2018 . Consultado el 27 de junio de 2018 .
  28. "Twitter de Garry Kasparov" . 24 de agosto de 2018. Consultado el 24 de agosto de 2018 .
  29. Park, Morgan (11 de agosto de 2018). "Cómo los OpenAI Five destrozaron a un equipo de profesionales de Dota 2" . PC Gamer . Recuperado el 25 de mayo de 2020 .
  30. Gault, Matthew (17 de agosto de 2018). "OpenAI está venciendo a los humanos en 'Dota 2' porque básicamente está haciendo trampa" . Vice . Consultado el 25 de mayo de 2020 .
  31. Statt, Nick (30 de octubre de 2019). "La IA de DeepMind para StarCraft 2 ahora es mejor que el 99,8 por ciento de todos los jugadores humanos" . The Verge . Consultado el 25 de mayo de 2020 .
  32. ^ Abierto AI; Andrychowicz, Marcin; Panadero, Bowen; Chociej, Maciek; Józefowicz, Rafał; McGrew, Bob; Pachocki, Jakub; Petron, Arturo; Plappert, Matías; Powell, Glenn; Rayo, Alex; Schneider, Jonás; Sidor, Szymon; Tobin, Josh; Welinder, Peter; Weng, Lilian; Zaremba, Wojciech (2019). "Aprendiendo a manipular con destreza las manos". arXiv : 1808.00177v5 [ cs.LG ].
  33. ^ Abierto AI; Akkaya, Ilge; Andrychowicz, Marcin; Chociej, Maciek; Litwin, Mateusz; McGrew, Bob; Petron, Arturo; Dolor, Alex; Plappert, Matías; Powell, Glenn; Ribas, Rafael (2019). "Resolver el cubo de Rubik con una mano de robot". arXiv : 1910.07113v1 [ cs.LG ].
  • Sitio web oficial
  • Blog oficial