Articulo de referencia

Aprendizaje automático en videojuegos

Las técnicas de inteligencia artificial y aprendizaje automático se utilizan en videojuegos para una amplia variedad de aplicaciones, como el control de personajes no jugables (...

Las técnicas de inteligencia artificial y aprendizaje automático se utilizan en videojuegos para una amplia variedad de aplicaciones, como el control de personajes no jugables (NPC), la generación de contenido procedimental (PCG) y la generación de contenido basada en aprendizaje profundo. El aprendizaje automático es un subconjunto de la inteligencia artificial que utiliza datos históricos para construir modelos predictivos y analíticos. Esto contrasta notablemente con los métodos tradicionales de inteligencia artificial, como los árboles de búsqueda y los sistemas expertos .

La información sobre técnicas de aprendizaje automático en el campo de los videojuegos es conocida principalmente por el público a través de proyectos de investigación, ya que la mayoría de las empresas de videojuegos optan por no publicar información específica sobre su propiedad intelectual . La aplicación más conocida del aprendizaje automático en los videojuegos es probablemente el uso de agentes de aprendizaje profundo que compiten con jugadores humanos profesionales en juegos de estrategia complejos . Se ha aplicado significativamente el aprendizaje automático en juegos como Atari /ALE, Doom , Minecraft , StarCraft y carreras de coches. [ 1 ] Otros juegos que no existían originalmente como videojuegos, como el ajedrez y el Go, también se han visto afectados por el aprendizaje automático. [ 2 ]

Descripción general de las técnicas de aprendizaje automático relevantes

Una red neuronal artificial es un grupo interconectado de nodos, similar a la vasta red de neuronas del cerebro . En este caso, cada nodo circular representa una neurona artificial y una flecha representa una conexión desde la salida de una neurona artificial hasta la entrada de otra.

Aprendizaje profundo

El aprendizaje profundo es un subconjunto del aprendizaje automático que se centra en el uso de redes neuronales artificiales (RNA) para aprender a resolver tareas complejas. Este método utiliza múltiples capas de RNA y otras técnicas para extraer información de forma progresiva a partir de una entrada. Debido a este complejo enfoque por capas, los modelos de aprendizaje profundo suelen requerir máquinas potentes para su entrenamiento y ejecución.

Redes neuronales convolucionales

Las redes neuronales convolucionales (CNN) son redes neuronales artificiales (RNA) especializadas que se utilizan a menudo para analizar datos de imágenes. Este tipo de redes son capaces de aprender patrones invariantes a la traslación , es decir, patrones que no dependen de la ubicación. Las CNN pueden aprender estos patrones de forma jerárquica, lo que significa que las primeras capas convolucionales aprenden patrones locales más pequeños, mientras que las capas posteriores aprenden patrones más grandes basándose en los patrones anteriores. [ 3 ] La capacidad de una CNN para aprender datos visuales la ha convertido en una herramienta de uso común para el aprendizaje profundo en videojuegos. [ 4 ] [ 5 ]

Red neuronal recurrente

Las redes neuronales recurrentes son un tipo de red neuronal artificial (RNA) diseñada para procesar secuencias de datos en orden, una parte a la vez en lugar de todas simultáneamente. Una RNA recorre cada parte de una secuencia, utilizando la parte actual junto con la memoria de las partes anteriores para generar una salida. Este tipo de RNA es muy eficaz en tareas como el reconocimiento de voz y otros problemas que dependen en gran medida del orden temporal. Existen varios tipos de RNA con diferentes configuraciones internas; la implementación básica adolece de una falta de memoria a largo plazo debido al problema del gradiente evanescente , por lo que rara vez se utiliza en comparación con implementaciones más recientes. [ 3 ]

Memoria a corto y largo plazo

Una red de memoria a corto y largo plazo (LSTM) es una implementación específica de una RNN diseñada para abordar el problema del gradiente evanescente que se observa en las RNN simples, el cual lleva a que estas "olviden" gradualmente partes anteriores de una secuencia de entrada al calcular la salida de una parte actual. Las LSTM resuelven este problema mediante la adición de un sistema complejo que utiliza una entrada/salida adicional para realizar un seguimiento de los datos a largo plazo. [ 3 ] Las LSTM han logrado resultados muy sólidos en diversos campos y han sido utilizadas por varios agentes de aprendizaje profundo de gran relevancia en videojuegos. [ 6 ] [ 4 ]

Aprendizaje por refuerzo

El aprendizaje por refuerzo es el proceso de entrenar a un agente mediante recompensas y/o castigos. La forma en que se recompensa o castiga a un agente depende en gran medida del problema; por ejemplo, se le otorga una recompensa positiva por ganar un juego o una negativa por perder. El aprendizaje por refuerzo se utiliza ampliamente en el campo del aprendizaje automático y se puede observar en métodos como el aprendizaje Q , la búsqueda de políticas , las redes Q profundas y otros. Ha demostrado un excelente rendimiento tanto en el campo de los juegos como en el de la robótica . [ 7 ]

Neuroevolución

La neuroevolución implica el uso de redes neuronales y algoritmos evolutivos . En lugar de utilizar el descenso de gradiente, como la mayoría de las redes neuronales, los modelos de neuroevolución emplean algoritmos evolutivos para actualizar las neuronas de la red. Los investigadores afirman que este proceso tiene menos probabilidades de quedarse atascado en un mínimo local y es potencialmente más rápido que las técnicas de aprendizaje profundo más avanzadas. [ 8 ]

agentes de aprendizaje profundo

Los agentes de aprendizaje automático se han utilizado para reemplazar a un jugador humano en lugar de funcionar como NPC, que se agregan deliberadamente a los videojuegos como parte de la mecánica de juego diseñada . Los agentes de aprendizaje profundo han logrado resultados impresionantes cuando se utilizan en competencia tanto con humanos como con otros agentes de inteligencia artificial. [ 2 ] [ 9 ]

Ajedrez

El ajedrez es un juego de estrategia por turnos que se considera un problema de IA complejo debido a la complejidad computacional de su tablero. Juegos de estrategia similares suelen resolverse mediante algún tipo de búsqueda en árbol minimax . Se sabe que este tipo de agentes de IA han vencido a jugadores humanos profesionales, como en el histórico encuentro de 1997 entre Deep Blue y Garry Kasparov . Desde entonces, los agentes de aprendizaje automático han demostrado un éxito cada vez mayor que los agentes de IA anteriores.

Ir

El Go es otro juego de estrategia por turnos que se considera un problema de IA aún más difícil que el ajedrez. El espacio de estados del Go es de aproximadamente 10¹⁷⁰ estados posibles del tablero, en comparación con los 10¹²⁰ estados del tablero del ajedrez. Antes de los recientes modelos de aprendizaje profundo, los agentes de IA de Go solo podían jugar al nivel de un aficionado humano. [ 5 ]

AlphaGo

AlphaGo de Google, en 2015, fue el primer agente de IA en vencer a un jugador profesional de Go. [ 5 ] AlphaGo utilizó un modelo de aprendizaje profundo para entrenar los pesos de una búsqueda en árbol de Monte Carlo (MCTS). El modelo de aprendizaje profundo constaba de dos redes neuronales artificiales (ANN), una red de políticas para predecir las probabilidades de los movimientos potenciales de los oponentes y una red de valores para predecir la probabilidad de victoria de un estado dado. El modelo de aprendizaje profundo permite al agente explorar los estados potenciales del juego de forma más eficiente que una MCTS convencional. La red se entrenó inicialmente con partidas de jugadores humanos y posteriormente se entrenó con partidas contra sí misma.

AlphaGo Zero

AlphaGo Zero , otra implementación de AlphaGo, pudo entrenarse completamente jugando contra sí mismo. Logró alcanzar rápidamente las capacidades del agente anterior. [ 10 ]

Serie StarCraft

StarCraft y su secuela, StarCraft II, sonvideojuegos de estrategia en tiempo real (RTS) que se han convertido en entornos populares para la investigación de IA. Blizzard y DeepMind han colaborado para lanzar un entorno público de StarCraft 2 para la investigación de IA. [ 11 ] Se han probado varios métodos de aprendizaje profundo en ambos juegos, aunque la mayoría de los agentes suelen tener problemas para superar a la IA predeterminada con trucos activados o jugadores expertos. [ 1 ]

Estrella Alfa

Alphastar fue el primer agente de IA en vencer a jugadores profesionales de StarCraft 2 sin ninguna ventaja en el juego. La red de aprendizaje profundo del agente inicialmente recibió entrada de una versión simplificada y alejada del estado del juego, pero luego se actualizó para jugar usando una cámara como otros jugadores humanos. Los desarrolladores no han publicado públicamente el código ni la arquitectura de su modelo, pero han enumerado varias técnicas de aprendizaje automático de vanguardia como el aprendizaje por refuerzo profundo relacional, la memoria a corto y largo plazo , las cabezas de política autorregresivas, las redes de punteros y la línea base de valor centralizado. [ 4 ] Alphastar fue entrenado inicialmente con aprendizaje supervisado, viendo repeticiones de muchas partidas humanas para aprender estrategias básicas. Luego se entrenó contra diferentes versiones de sí mismo y se mejoró a través del aprendizaje por refuerzo. La versión final fue enormemente exitosa, pero solo se entrenó para jugar en un mapa específico en un enfrentamiento espejo protoss.

Dota 2

Dota 2 es un juego multijugador en línea de arena de batalla (MOBA). Al igual que en otros juegos complejos, los agentes de IA tradicionales no han podido competir al mismo nivel que los jugadores humanos profesionales. La única información ampliamente publicada sobre agentes de IA que se han probado en Dota 2 esel agente Five de aprendizaje profundo de OpenAI .

OpenAI Cinco

OpenAI Five utilizó redes de memoria a corto y largo plazo separadas para aprender a cada héroe. Se entrenó utilizando una técnica de aprendizaje por refuerzo conocida como Proximal Policy Learning, ejecutándose en un sistema que contenía 256 GPU y 128 000 núcleos de CPU . [ 6 ] Five se entrenó durante meses, acumulando 180 años de experiencia de juego cada día, antes de enfrentarse a jugadores profesionales. [ 12 ] [ 13 ] Finalmente, logró vencer al equipo campeón de esports de Dota 2 de 2018 en una serie de juegos de 2019.

Aniquilación planetaria

Planetary Annihilation es un juego de estrategia en tiempo real que se centra en la guerra a gran escala. Los desarrolladores utilizan redes neuronales artificiales (RNA) en su agente de IA predeterminado. [ 14 ]

Comandante Supremo 2

Supreme Commander 2 es unvideojuego de estrategia en tiempo real (RTS). El juego utiliza perceptrones multicapa (MLP) para controlar la reacción de un pelotón ante las unidades enemigas encontradas. Se utilizan un total de cuatro MLP, uno para cada tipo de pelotón: terrestre, naval, bombardero y caza. [ 15 ]

Gran Turismo

Gran Turismo es una franquicia de juegos de PlayStation que simula experiencias de carreras y conducción realistas. En 2022, los investigadores de IA de Sony presentaron a Sophy, un agente que puede jugar a Gran Turismo con un rendimiento igual o superior al de los mejores pilotos de eSports del mundo. [ 16 ] [ 17 ] La solución implementada se basa en el aprendizaje profundo por refuerzo sin modelo.

Juegos generalizados

Se han realizado intentos para crear agentes de aprendizaje automático capaces de jugar a más de un juego. Estos agentes de juego "generales" se entrenan para comprender los juegos basándose en propiedades comunes entre ellos.

AlphaZero

AlphaZero es una versión modificada de AlphaGo Zero capaz de jugar Shogi , ajedrez y Go . El agente modificado comienza con las reglas básicas del juego y se entrena completamente mediante autoaprendizaje. DeepMind logró entrenar a este agente generalizado para que compitiera con versiones anteriores de sí mismo en Go, así como con los mejores agentes en los otros dos juegos. [ 2 ]

Fortalezas y debilidades de los agentes de aprendizaje profundo

Los agentes de aprendizaje automático no suelen abordarse en muchos cursos de diseño de videojuegos. Su uso previo en juegos puede no haber sido muy práctico, ya que incluso la versión de AlphaGo de 2015 requirió cientos de CPU y GPU para alcanzar un nivel de entrenamiento sólido. [ 2 ] Esto limita potencialmente la creación de agentes de aprendizaje profundo altamente efectivos a grandes corporaciones o personas con recursos económicos muy elevados. El extenso tiempo de entrenamiento de los enfoques basados ​​en redes neuronales también puede durar semanas en estas potentes máquinas. [ 4 ]

El problema de entrenar eficazmente modelos basados ​​en redes neuronales artificiales (RNA) va más allá de entornos de hardware potentes; encontrar una buena manera de representar los datos y aprender cosas significativas de ellos también suele ser un problema difícil. Los modelos de RNA a menudo se sobreajustan a datos muy específicos y tienen un rendimiento deficiente en casos más generalizados. AlphaStar muestra esta debilidad, a pesar de poder vencer a jugadores profesionales, solo puede hacerlo en un único mapa al jugar un enfrentamiento espejo de Protoss. [ 4 ] OpenAI Five también muestra esta debilidad, solo pudo vencer a un jugador profesional cuando se enfrentó a un conjunto de héroes muy limitado de todo el juego. [ 13 ] Este ejemplo muestra lo difícil que puede ser entrenar un agente de aprendizaje profundo para que tenga un buen rendimiento en situaciones más generalizadas.

Los agentes de aprendizaje automático han demostrado un gran éxito en una variedad de juegos diferentes. [ 12 ] [ 2 ] [ 4 ] Sin embargo, los agentes demasiado competentes también corren el riesgo de hacer que los juegos sean demasiado difíciles para los jugadores nuevos o casuales. Las investigaciones han demostrado que un desafío que está muy por encima del nivel de habilidad de un jugador arruinará el disfrute de los jugadores menos experimentados. [ 18 ] Es probable que estos agentes altamente entrenados solo sean deseables contra jugadores humanos muy hábiles que tienen muchas horas de experiencia en un juego determinado. Dados estos factores, es probable que los agentes de aprendizaje profundo altamente efectivos solo sean una opción deseable en juegos que tienen una gran escena competitiva, donde pueden funcionar como una opción de práctica alternativa a un jugador humano experto.

Jugadores basados ​​en visión artificial

La visión artificial se centra en entrenar a las computadoras para que adquieran un alto nivel de comprensión de imágenes o videos digitales. Muchas técnicas de visión artificial también incorporan formas de aprendizaje automático y se han aplicado a diversos videojuegos. Esta aplicación de la visión artificial se centra en interpretar eventos del juego utilizando datos visuales. En algunos casos, los agentes de inteligencia artificial han utilizado técnicas sin modelo para aprender a jugar sin ninguna conexión directa con la lógica interna del juego, utilizando únicamente datos de video como entrada.

Apestar

Andrej Karpathy ha demostrado que una red neuronal relativamente trivial con una sola capa oculta es capaz de ser entrenada para jugar Pong basándose únicamente en datos de la pantalla. [ 19 ] [ 20 ]

Juegos de Atari

En 2013, un equipo de DeepMind demostró el uso del aprendizaje profundo Q para jugar a varios videojuegos de Atari —Beamrider , Breakout , Enduro , Pong , Q*bert , Seaquest y Space Invaders— a partir de datos de pantalla. [ 21 ] El equipo amplió su trabajo para crear un algoritmo de aprendizaje llamado MuZero que era capaz de "aprender" las reglas y desarrollar estrategias ganadoras para más de 50 juegos diferentes de Atari basándose en datos de pantalla. [ 22 ] [ 23 ]

Condenar

Doom (1993) es un juego de disparos en primera persona (FPS). Estudiantes investigadores de la Universidad Carnegie Mellon utilizaron técnicas de visión artificial para crear un agente capaz de jugar utilizando únicamente los píxeles de la imagen del juego. Los estudiantes emplearon capas de redes neuronales convolucionales (CNN) para interpretar los datos de imagen entrantes y generar información válida para una red neuronal recurrente , la cual se encargaba de ejecutar los movimientos del juego. [ 24 ]

Super Mario

Otros usos de las técnicas de aprendizaje profundo basadas en la visión para jugar videojuegos han incluido jugar Super Mario Bros. usando solo entrada de imágenes, usando aprendizaje Q profundo para el entrenamiento. [ 19 ]

Minecraft

Investigadores de OpenAI crearon aproximadamente 2000 horas de partidas de Minecraft codificadas con las entradas humanas necesarias y luego entrenaron un modelo de aprendizaje automático para comprender la retroalimentación del video a partir de la entrada. Posteriormente, los investigadores utilizaron ese modelo con 70 000 horas de partidas de Minecraft disponibles en YouTube para ver qué tan bien podía el modelo crear la entrada para que coincidiera con ese comportamiento y aprender más a partir de él, como por ejemplo, aprender los pasos y el proceso para crear un pico de diamante. [ 25 ] [ 26 ] En 2023, el algoritmo DreamerV3 entrenó una política capaz de obtener diamantes de forma autónoma. [ 27 ] [ 28 ]

Aprendizaje automático para la generación de contenido procedimental en juegos

El aprendizaje automático ha sido objeto de investigación para su uso en la recomendación y generación de contenido. La generación de contenido procedimental ( GCP) es el proceso de crear datos algorítmicamente en lugar de manualmente. Este tipo de contenido se utiliza para añadir rejugabilidad a los juegos sin depender de las constantes adiciones de los desarrolladores humanos. La GCP se ha utilizado en varios juegos para diferentes tipos de generación de contenido, ejemplos de los cuales incluyen armas en Borderlands 2 , [ 29 ] todos los diseños de mundos en Minecraft [ 30 ] y universos enteros en No Man's Sky . [ 31 ] Los enfoques comunes para la GCP incluyen técnicas que involucran gramáticas , algoritmos basados ​​en búsqueda y programación lógica . [ 32 ] Estos enfoques requieren que los humanos definan manualmente el rango de contenido posible, lo que significa que un desarrollador humano decide qué características componen una pieza válida de contenido generado. El aprendizaje automático es teóricamente capaz de aprender estas características cuando se le proporcionan ejemplos para entrenar, lo que reduce enormemente el paso complejo de que los desarrolladores especifiquen los detalles del diseño del contenido. [ 33 ] Las técnicas de aprendizaje automático utilizadas para la generación de contenido incluyen redes neuronales recurrentes (RNN) de memoria a corto y largo plazo (LSTM ), redes generativas antagónicas (GAN) y agrupamiento K-means . No todas estas técnicas utilizan redes neuronales artificiales (ANN), pero el rápido desarrollo del aprendizaje profundo ha aumentado enormemente el potencial de las técnicas que sí las utilizan. [ 33 ]

Carrera armamentística galáctica

Galactic Arms Race es un videojuego de disparos espaciales que utiliza PCG basado en neuroevolución para generar armas únicas para el jugador. Este juego fue finalista en el Indie Game Challenge de 2010 y su artículo de investigación relacionado ganó el premio al mejor artículo en la Conferencia IEEE de 2009 sobre Inteligencia Computacional y Juegos. Los desarrolladores utilizan una forma de neuroevolución llamada cgNEAT para generar contenido nuevo basado en las preferencias personales de cada jugador. [ 34 ]

Cada elemento generado está representado por una red neuronal artificial (RNA) especial conocida como Red de Producción de Patrones Composicionales (CPPN). Durante la fase evolutiva del juego, cgNEAT calcula la aptitud de los elementos actuales en función del uso del jugador y otras métricas de juego. Esta puntuación de aptitud se utiliza para decidir qué CPPN se reproducirán para crear un nuevo elemento. El resultado final es la generación de nuevos efectos de armas según las preferencias del jugador.

Super Mario Bros.

Super Mario Bros. ha sido utilizado por varios investigadores para simular la creación de niveles de PCG. Diversos intentos han utilizado diferentes métodos. Una versión de 2014 utilizó n-gramas para generar niveles similares a los de entrenamiento, que posteriormente se mejoró mediante el uso de MCTS para guiar la generación. [ 35 ] Estas generaciones a menudo no eran óptimas al considerar métricas de juego como el movimiento del jugador; un proyecto de investigación independiente en 2017 intentó resolver este problema generando niveles basados ​​en el movimiento del jugador utilizando cadenas de Markov. [ 36 ] Estos proyectos no fueron sometidos a pruebas humanas y podrían no cumplir con los estándares de jugabilidad humana.

La leyenda de Zelda

Investigadores de la Universidad de California, Santa Cruz, intentaron crear niveles mediante PCG para The Legend of Zelda . Para ello, utilizaron una red bayesiana para aprender información de alto nivel a partir de niveles existentes, mientras que el análisis de componentes principales (PCA) se empleó para representar las distintas características de bajo nivel de estos niveles. [ 37 ] Los investigadores utilizaron PCA para comparar los niveles generados con los creados por humanos y descubrieron que eran muy similares. Esta prueba no incluyó la jugabilidad ni pruebas humanas de los niveles generados.

Aprendizaje profundo para la generación de contenido en juegos

La introducción de redes generativas antagónicas , primero, y luego de modelos de difusión, permite generar contenido dentro del juego en tiempo de ejecución utilizando enfoques no procedimentales. Algunos ejemplos son:

  • La impresora 3D está disponible en InZOI (disponible en acceso anticipado), un juego de simulación de vida desarrollado por InZOI Studio y publicado por Krafton . A partir de un archivo de imagen 2D proporcionado por el usuario, la impresora 3D genera el objeto 3D correspondiente, que el usuario puede colocar en el juego o usar para decorar su avatar. [ 38 ]
  • La solución de generación de terreno implementada en Prologue: Go Wayback! (acceso anticipado: fecha por anunciar, con pruebas de juego en curso a principios de 2025), un juego de supervivencia desarrollado por PlayerUnknown Productions . El enfoque permite generar un nuevo mapa de juego cada vez que se inicia el juego. [ 39 ]

Generación musical

La música suele estar presente en los videojuegos y puede ser un elemento crucial para influir en el estado de ánimo de diferentes situaciones y puntos de la historia. El aprendizaje automático se ha utilizado en el campo experimental de la generación de música; es especialmente adecuado para procesar datos brutos no estructurados y formar representaciones de alto nivel que podrían aplicarse al diverso campo de la música. [ 40 ] La mayoría de los métodos intentados han implicado el uso de redes neuronales artificiales (RNA) de alguna forma. Los métodos incluyen el uso de redes neuronales de alimentación directa básicas , autoencoders , máquinas de Boltzmann restringidas , redes neuronales recurrentes , redes neuronales convolucionales , redes generativas antagónicas (GAN) y arquitecturas compuestas que utilizan múltiples métodos. [ 40 ]

Sistema de generación de música simbólica para melodías de videojuegos VRAE

El artículo de investigación de 2014 sobre "Autoencoders recurrentes variacionales" intentó generar música a partir de canciones de 8 videojuegos diferentes. Este proyecto es uno de los pocos realizados exclusivamente con música de videojuegos. La red neuronal del proyecto logró generar datos muy similares a los de los juegos con los que se entrenó. [ 41 ] Los datos generados no se tradujeron en música de buena calidad.

Referencias

  1. 1 2 Justesen, Niels; Bontrager, Philip; Togelius, Julian; Risi, Sebastian (2019). "Aprendizaje profundo para jugar videojuegos". IEEE Transactions on Games . 12 : 1–20 . arXiv : 1708.07902 . doi : 10.1109/tg.2019.2896986 . ISSN 2475-1502 . S2CID 37941741 .  
  2. 1 2 3 4 5 Silver, David; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan (2018-12-06). "Un algoritmo general de aprendizaje por refuerzo que domina el ajedrez, el shogi y el Go mediante el autoaprendizaje" (PDF) . Science . 362 (6419): 1140– 1144. Bibcode : 2018Sci...362.1140S . doi : 10.1126/science.aar6404 . ISSN 0036-8075 . PMID 30523106. S2CID 54457125 .   
  3. 1 2 3 Chollet, Francois (28-10-2017). Aprendizaje profundo con Python . Manning Publications Company. ISBN 9781617294433OCLC 1019988472 
  4. 1 2 3 4 5 6 "AlphaStar: Dominando el juego de estrategia en tiempo real StarCraft II" . DeepMind . 24 de enero de 2019. Recuperado el 4 de junio de 2019 .
  5. 1 2 3 Plata, David; Huang, Aja; Maddison, Chris J.; Guez, Arturo; Sifré, Laurent; van den Driessche, George; Schrittwieser, Julián; Antonoglou, Ioannis; Panneershelvam, Veda (enero de 2016). "Dominar el juego de Go con redes neuronales profundas y búsqueda de árboles". Naturaleza . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038/naturaleza16961 . ISSN 0028-0836 . PMID 26819042 . S2CID 515925 .   
  6. 1 2 "OpenAI Five" . OpenAI . 25-06-2018 . Recuperado el 04-06-2019 .
  7. Russell, Stuart J. (Stuart Jonathan) (2015). Inteligencia artificial : un enfoque moderno . Norvig, Peter (Tercera edición india). Noida, India. ISBN   9789332543515OCLC 928841872 {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  8. Clune, Jeff; Stanley, Kenneth O.; Lehman, Joel; Conti, Edoardo; Madhavan, Vashisht; Such, Felipe Petroski (2017-12-18). "Neuroevolución profunda: los algoritmos genéticos son una alternativa competitiva para entrenar redes neuronales profundas para el aprendizaje por refuerzo". arXiv : 1712.06567 [ cs.NE ].
  9. Zhen, Jacky Shunjie; Watson, Ian (2013), "Neuroevolución para la microgestión en el juego de estrategia en tiempo real Starcraft: Brood War", AI 2013: Avances en inteligencia artificial , Lecture Notes in Computer Science, vol. 8272, Springer International Publishing, pp. 259–270 , CiteSeerX 10.1.1.703.5110 , doi : 10.1007/978-3-319-03680-9_28 , ISBN    9783319036793
  10. Silver, David; Schrittwieser, Julian; Simonyan, Karen; Antonoglou, Ioannis; Huang, Aja; Guez, Arthur; Hubert, Thomas; Baker, Lucas; Lai, Matthew (octubre de 2017). "Dominando el juego de Go sin conocimiento humano" ( PDF) . Nature . 550 (7676): 354–359 . Bibcode : 2017Natur.550..354S . doi : 10.1038/nature24270 . ISSN 0028-0836 . PMID 29052630. S2CID 205261034 .   
  11. Tsing, Rodney; Repp, Jacob; Ekermo, Anders; Lawrence, David; Brunasso, Anthony; Keet, Paul; Calderone, Kevin; Lillicrap, Timothy; Silver, David (2017-08-16). "StarCraft II: Un nuevo desafío para el aprendizaje por refuerzo". arXiv : 1708.04782 [ cs.LG ].
  12. 1 2 "OpenAI Five" . OpenAI . Consultado el 4 de junio de 2019 .
  13. 1 2 "Cómo entrenar a tus cinco OpenAI" . OpenAI . 15 de abril de 2019. Consultado el 4 de junio de 2019 .
  14. xavdematos (7 de junio de 2014). "Conoce a la computadora que está aprendiendo a matar y al hombre que programó el caos" . Engadget . Consultado el 4 de junio de 2019 .
  15. Robbins, Michael (6 de septiembre de 2019). «Uso de redes neuronales para controlar la respuesta de los agentes a las amenazas» (PDF) . Game AI Pro 360: Guía de tácticas y estrategia . CRC Press: 55–64 . doi : 10.1201/9780429054969-5 . ISBN 9780429054969. S2CID 208122019 . Consultado el 30 de noviembre de 2022 . 
  16. Wurman, Peter R.; Barrett, Samuel; Kawamoto, Kenta; MacGlashan, James; Subramanian, Kaushik; Walsh, Thomas J.; Capobianco, Roberto; Devlic, Alisa; Eckert, Franziska; Fuchs, Florian; Gilpin, Leilani; Khandelwal, Piyush; Kompella, Varun; Lin, HaoChih; MacAlpine, Patrick (febrero de 2022). "Superando a los campeones de Gran Turismo con aprendizaje profundo por refuerzo" . Nature . 602 (7896): 223– 228. Bibcode : 2022Natur.602..223W . doi : 10.1038/s41586-021-04357-7 . ISSN 1476-4687 . PMID 35140384 .  
  17. "Gran Turismo Sophy" . www.gran-turismo.com . Consultado el 13 de abril de 2025 .
  18. Sweetser, Penelope; Wyeth, Peta (1 de julio de 2005). "GameFlow". Computers in Entertainment . 3 (3): 3. doi : 10.1145/1077246.1077253 . ISSN 1544-3574 . S2CID 2669730 .  
  19. 1 2 Jones, M. Tim (7 de junio de 2019). "Aprendizaje automático y juegos" . IBM Developer . Recuperado el 3 de febrero de 2020 .
  20. "Aprendizaje profundo por refuerzo: Pong a partir de píxeles" . karpathy.github.io . Consultado el 3 de febrero de 2020 .
  21. Mnih, Volodymyr; Kavukcuoglu, Koray; Silver, David; Graves, Alex; Antonoglou, Ioannis; Wierstra, Daan; Riedmiller, Martin (2013-12-19). "Playing Atari with Deep Reinforcement Learning". arXiv : 1312.5602 [ cs.LG ].
  22. Bonifacic, Igor (23 de diciembre de 2020). "La última IA de DeepMind puede dominar juegos sin que se le digan sus reglas" . Engadget . Consultado el 23 de diciembre de 2020 .
  23. Schrittwieser, Julian; Antonoglou, Ioannis; Hubert, Thomas; Simonyan, Karen; Sifre, Laurent; Schmitt, Simon; Guez, Arthur; Lockhart, Edward; Hassabis, Demis; Graepel, Thore; Lillicrap, Timothy; Silver, David (2020). "Dominando Atari, Go, ajedrez y shogi mediante la planificación con un modelo aprendido". Nature . 588 (7839): 604– 609. arXiv : 1911.08265 . Bibcode : 2020Natur.588..604S . doi : 10.1038/s41586-020-03051-4 . PMID 33361790 . S2CID 208158225 .  
  24. Lample, Guillaume; Chaplot, Devendra Singh (2017). "Jugando a juegos FPS con aprendizaje profundo por refuerzo" . Actas de la Trigésimo Primera Conferencia AAAI sobre Inteligencia Artificial . AAAI'17. San Francisco, California, EE. UU.: AAAI Press: 2140–2146 . arXiv : 1609.05521 . Bibcode : 2016arXiv160905521L .
  25. Matthews, David (27 de junio de 2022). "Se entrenó a una IA para jugar Minecraft con 70 000 horas de vídeos de YouTube" . IGN . Consultado el 8 de julio de 2022 .
  26. Baker, Bowen; Akkaya, Ilge; Zhokhov, Peter; Huizinga, Joost; Tang, Jie; Ecoffet, Adrien; Houghton, Brandon; Sampedro, Raul; Clune, Jeff (2022). "Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos". arXiv : 2206.11795 [ cs.LG ].
  27. Hafner, Danijar; Pasukonis, Jurgis; Ba, Jimmy; Lillicrap, Timothy (10 de enero de 2023). "Dominando diversos dominios a través de modelos del mundo". arXiv : 2301.04104 [ cs.AI ].
  28. Hafner, Danijar; Pasukonis, Jurgis; Ba, Jimmy; Lillicrap, Timothy (abril de 2025). "Dominando diversas tareas de control a través de modelos del mundo" . Nature . 640 (8059): 647– 653. Bibcode : 2025Natur.640..647H . doi : 10.1038/ s41586-025-08744-2 . ISSN 1476-4687 . PMC 12003158. PMID 40175544 .   
  29. Yin-Poole, Wesley (16 de julio de 2012). "¿Cuántas armas hay en Borderlands 2?" . Eurogamer . Consultado el 4 de junio de 2019 .
  30. "Generación de terreno, Parte 1" . The Word of Notch . Archivado del original el 11 de marzo de 2019. Consultado el 4 de junio de 2019 .
  31. Parkin, Simon. "Un universo de ciencia ficción creado por algoritmos" . MIT Technology Review . Consultado el 4 de junio de 2019 .
  32. Togelius, Julian; Shaker, Noor; Nelson, Mark J. (2016), "Introducción", Generación de contenido procedimental en juegos , Síntesis computacional y sistemas creativos, Springer International Publishing, pp. 1–15 , doi : 10.1007/978-3-319-42716-4_1 , ISBN  9783319427140{{citation}}: CS1 mantenimiento: parámetro de trabajo con ISBN ( enlace )
  33. 1 2 Summerville, Adam; Snodgrass, Sam; Guzdial, Matthew; Holmgard, Christoffer; Hoover, Amy K.; Isaksen, Aaron; Nealen, Andy; Togelius, Julian (septiembre de 2018). "Generación de contenido procedimental mediante aprendizaje automático (PCGML)". IEEE Transactions on Games . 10 (3): 257– 270. arXiv : 1702.00539 . Bibcode : 2018ITGam..10..257S . doi : 10.1109/tg.2018.2846639 . ISSN 2475-1502 . S2CID 9950600 .  
  34. Hastings, Erin J.; Guha, Ratan K.; Stanley, Kenneth O. (septiembre de 2009). «Evolución del contenido en el videojuego Galactic Arms Race» (PDF) . Simposio IEEE de 2009 sobre Inteligencia Computacional y Juegos . IEEE. págs. 241–248 . doi : 10.1109/cig.2009.5286468 . ISBN  9781424448142. S2CID 16598064 . Archivado del original (PDF) el 12-11-2020 . Recuperado el 22-02-2020 . 
  35. Summerville, Adam. "MCMCTS PCG 4 SMB: Búsqueda en árbol de Monte Carlo para guiar la generación de niveles de plataformas" . www.aaai.org . Consultado el 4 de junio de 2019 .
  36. Snodgrass, Sam; Ontañón, Santiago (agosto de 2017). «Modelos de movimiento del jugador para la generación de niveles en videojuegos». Actas de la Vigésimo Sexta Conferencia Internacional Conjunta sobre Inteligencia Artificial. California: International Joint Conferences on Artificial Intelligence Organization. pp. 757–763 . doi : 10.24963/ijcai.2017/105 . ISBN  9780999241103.
  37. Summerville, James. "Muestreo de Hyrule: Generación de niveles probabilísticos multitécnica para juegos de rol de acción" . www.aaai.org . Consultado el 4 de junio de 2019 .
  38. Rizwan, Rabiya (2025-04-02). "InZoi: Cómo usar la impresora 3D" . TheGamer . Recuperado el 13 de abril de 2025 .
  39. "Generación guiada en el prólogo: paisajes generados por aprendizaje automático" . playerunknownproductions.net . Consultado el 13 de abril de 2025 .
  40. ^ Pachet , François-David; Hadjeres, Gaëtan; Briot, Jean-Pierre (5 de septiembre de 2017). "Técnicas de aprendizaje profundo para la generación musical: una encuesta". arXiv : 1709.01620 [ cs.SD ].
  41. ^ van Amersfoort, Joost R.; Fabio, Otto (20 de diciembre de 2014). "Codificadores automáticos recurrentes variacionales". arXiv : 1412.6581 [ estad.ML ].