
Una red generativa antagónica ( GAN ) es una clase de marcos de aprendizaje automático y un marco destacado para abordar la inteligencia artificial generativa . El concepto fue desarrollado inicialmente por Ian Goodfellow y sus colegas en junio de 2014. [ 1 ] En una GAN, dos redes neuronales compiten entre sí en forma de un juego de suma cero , donde la ganancia de un agente es la pérdida de otro.
Dado un conjunto de entrenamiento, esta técnica aprende a generar nuevos datos con las mismas estadísticas que el conjunto de entrenamiento. Por ejemplo, una GAN entrenada con fotografías puede generar nuevas fotografías que parezcan, al menos superficialmente, auténticas para los observadores humanos, con muchas características realistas. Aunque originalmente se propuso como una forma de modelo generativo para el aprendizaje no supervisado , las GAN también han demostrado ser útiles para el aprendizaje semisupervisado , [ 2 ] el aprendizaje totalmente supervisado [ 3 ] y el aprendizaje por refuerzo . [ 4 ]
La idea central de una GAN se basa en el entrenamiento "indirecto" a través del discriminador, otra red neuronal que puede determinar cuán "realista" parece la entrada, la cual también se actualiza dinámicamente. [ 5 ] Esto significa que el generador no se entrena para minimizar la distancia a una imagen específica, sino para engañar al discriminador. Esto permite que el modelo aprenda de forma no supervisada.
Las GAN son similares al mimetismo en la biología evolutiva , con una carrera armamentística evolutiva entre ambas redes.
Definición
Matemático
La GAN original se define como el siguiente juego : [ 1 ]
Cada espacio de probabilidaddefine un juego GAN.
Hay dos jugadores: generador y discriminador.
El conjunto de estrategias del generador es, el conjunto de todas las medidas de probabilidaden.
El conjunto de estrategias del discriminador es el conjunto de núcleos de Markov., dóndees el conjunto de medidas de probabilidad en.
El juego GAN es un juego de suma cero , con función objetivo El generador tiene como objetivo minimizar la función objetivo, y el discriminador tiene como objetivo maximizar la función objetivo.
La tarea del generador es acercarseEs decir, ajustar su propia distribución de salida lo más posible a la distribución de referencia. La tarea del discriminador es generar un valor cercano a 1 cuando la entrada parece provenir de la distribución de referencia, y un valor cercano a 0 cuando la entrada parece provenir de la distribución del generador.
En la práctica
La red generativa genera candidatos mientras que la red discriminativa los evalúa. [ 1 ] Esto crea una competencia basada en distribuciones de datos, donde el generador aprende a mapear desde un espacio latente a la distribución de datos real, con el objetivo de producir candidatos que el discriminador no pueda distinguir de los datos reales. El objetivo del discriminador es identificar correctamente estos candidatos, pero a medida que el generador mejora, su tarea se vuelve más desafiante, aumentando la tasa de error del discriminador. [ 1 ] [ 6 ]
Un conjunto de datos conocido sirve como datos de entrenamiento inicial para el discriminador. El entrenamiento implica presentarle muestras del conjunto de datos de entrenamiento hasta que alcance una precisión aceptable. El generador se entrena en función de si logra engañar al discriminador. Normalmente, el generador se inicializa con una entrada aleatoria que se muestrea de un espacio latente predefinido (por ejemplo, una distribución normal multivariada ). Posteriormente, los candidatos sintetizados por el generador son evaluados por el discriminador. Se aplican procedimientos de retropropagación independientes a ambas redes para que el generador produzca mejores muestras, mientras que el discriminador se vuelve más hábil para detectar muestras sintéticas. [ 7 ] Cuando se utiliza para la generación de imágenes, el generador suele ser una red neuronal deconvolucional y el discriminador es una red neuronal convolucional .
Relación con otros métodos estadísticos de aprendizaje automático
Las GAN son modelos generativos implícitos , [ 8 ] lo que significa que no modelan explícitamente la función de verosimilitud ni proporcionan un medio para encontrar la variable latente correspondiente a una muestra dada, a diferencia de alternativas como el modelo generativo basado en flujo .

En comparación con las redes neuronales totalmente visibles, como WaveNet y PixelRNN, y los modelos autorregresivos en general, las GAN pueden generar una muestra completa en una sola pasada, en lugar de múltiples pasadas a través de la red.
En comparación con las máquinas de Boltzmann y el ICA lineal , no existe ninguna restricción en el tipo de función que utiliza la red.
Dado que las redes neuronales son aproximadores universales , las GAN son asintóticamente consistentes . A partir de 2026, se ha demostrado que los autoencoders variacionales son aproximadores universales [ 10 ] .
Propiedades matemáticas
Consideraciones teóricas de la medida
Esta sección presenta parte de la teoría matemática que sustenta estos métodos.
En la teoría de la probabilidad moderna basada en la teoría de la medida , un espacio de probabilidad también necesita estar equipado con un álgebra σ . Como resultado, una definición más rigurosa del juego GAN implicaría los siguientes cambios:
Cada espacio de probabilidaddefine un juego GAN.
El conjunto de estrategias del generador es, el conjunto de todas las medidas de probabilidaden el espacio de medidas.
El conjunto de estrategias del discriminador es el conjunto de núcleos de Markov., dóndees el álgebra σ de Borel en.
Dado que en la práctica nunca surgen problemas de mensurabilidad, no nos ocuparemos más de ellos.
Elección del conjunto de estrategias
En la versión más genérica del juego GAN descrito anteriormente, el conjunto de estrategias para el discriminador contiene todos los núcleos de Markov.y el conjunto de estrategias para el generador contiene distribuciones de probabilidad arbitrariasen.
Sin embargo, como se muestra a continuación, la estrategia discriminadora óptima contra cualquieres determinista, por lo que no hay pérdida de generalidad al restringir las estrategias del discriminador a funciones deterministas.En la mayoría de las aplicaciones,es una función de red neuronal profunda .
En cuanto al generador, mientrasEn teoría, podría ser cualquier distribución de probabilidad computable; en la práctica, suele implementarse como un pushforward :Es decir, comenzar con una variable aleatoria., dóndees una distribución de probabilidad que es fácil de calcular (como la distribución uniforme o la distribución gaussiana ), luego define una función. Luego la distribuciónes la distribución de.
En consecuencia, la estrategia del generador se define generalmente como simplemente, partidaimplícito. En este formalismo, el objetivo del juego GAN es
Reparametrización generativa
La arquitectura GAN tiene dos componentes principales. Uno es convertir la optimización en un juego, de forma, que es diferente del tipo habitual de optimización, de forma. La otra es la descomposición deen, lo cual puede entenderse como un truco de reparametrización.
Para comprender su importancia, es necesario comparar GAN con métodos anteriores para el aprendizaje de modelos generativos, los cuales estaban plagados de "cálculos probabilísticos intratables que surgen en la estimación de máxima verosimilitud y estrategias relacionadas". [ 1 ]
Al mismo tiempo, Kingma y Welling [ 11 ] y Rezende et al. [ 12 ] desarrollaron la misma idea de reparametrización en un método general de retropropagación estocástica. Entre sus primeras aplicaciones se encontraba el autoencoder variacional .
Orden de movimiento y equilibrios estratégicos
En el artículo original, así como en la mayoría de los artículos posteriores, se suele asumir que el generador se mueve primero y el discriminador se mueve segundo , lo que da como resultado el siguiente juego minimax:
Si tanto el conjunto de estrategias del generador como el del discriminador están abarcados por un número finito de estrategias, entonces por el teorema minimax ,Es decir, el orden de los movimientos no importa.
Sin embargo, dado que los conjuntos de estrategias no son finitamente generados, el teorema minimax no se aplica y la idea de "equilibrio" se vuelve delicada. A saber, existen los siguientes conceptos diferentes de equilibrio:
- Equilibrio cuando el generador se mueve primero y el discriminador se mueve después:
- Equilibrio cuando el discriminador se mueve primero y el generador se mueve después:
- equilibrio de Nash, que es estable bajo un orden de movimiento simultáneo:
Para juegos generales, estos equilibrios no tienen por qué coincidir, ni siquiera existir. Para el juego GAN original, todos estos equilibrios existen y son todos iguales. Sin embargo, para juegos GAN más generales, no necesariamente existen ni coinciden. [ 13 ]
Teoremas principales para juegos GAN
El artículo original de GAN demostró los siguientes dos teoremas: [ 1 ]
Teorema (el discriminador óptimo calcula la divergencia de Jensen-Shannon) — Para cualquier estrategia de generador fijo , sea la respuesta óptima, entonces
donde la derivada es la derivada de Radon-Nikodym , yes la divergencia de Jensen-Shannon .
Por la desigualdad de Jensen,
y de forma similar para el otro término. Por lo tanto, la respuesta óptima puede ser determinista, es decirpara alguna función, en cuyo caso
Para definir funciones de densidad adecuadas, definimos una medida base. :=\mu _{\text{ref}}+\mu _{G}} , lo que nos permite tomar las derivadas de Radon–Nikodym
con.
Entonces tenemos
El integrando es simplemente la entropía cruzada negativa entre dos variables aleatorias de Bernoulli con parámetrosyPodemos escribir esto como, dóndees la función de entropía binaria , por lo tanto
Esto significa que la estrategia óptima para el discriminador es, con
después del cálculo de rutina.
Interpretación : Para cualquier estrategia de generador fijoEl discriminador óptimo realiza un seguimiento de la razón de verosimilitud entre la distribución de referencia y la distribución del generador:dóndees la función logística . En particular, si la probabilidad previa para una imagenprovenir de la distribución de referencia es igual a, entonceses simplemente la probabilidad posterior de queProvenía de la distribución de referencia:
Teorema (el punto de equilibrio único) — Para cualquier juego GAN, existe un par Eso es a la vez un equilibrio secuencial y un equilibrio de Nash:
Es decir, el generador imita perfectamente la referencia y el discriminador emitede forma determinista en todas las entradas.
De la proposición anterior,
Para cualquier estrategia de discriminador fijo, cualquierconcentrado en el set
es una estrategia óptima para el generador. Por lo tanto,
Según la desigualdad de Jensen, el discriminador solo puede mejorar adoptando la estrategia determinista de jugar siempre. Por lo tanto,
Por la desigualdad de Jensen,
con igualdad si, entonces
Finalmente, para comprobar que se trata de un equilibrio de Nash, observe que cuando, tenemos
que siempre se maximiza por.
CuandoCualquier estrategia es óptima para el generador.
Entrenamiento y evaluación de GAN
Capacitación
Convergencia inestable
Si bien el juego GAN tiene un punto de equilibrio global único cuando tanto el generador como el discriminador tienen acceso a todos sus conjuntos de estrategias, el equilibrio ya no está garantizado cuando tienen un conjunto de estrategias restringido. [ 13 ]
En la práctica, el generador solo tiene acceso a medidas de forma, dóndees una función calculada por una red neuronal con parámetros, yes una distribución fácilmente muestreable, como la distribución uniforme o la distribución normal. De manera similar, el discriminador solo tiene acceso a funciones de forma, una función calculada por una red neuronal con parámetrosEstos conjuntos de estrategias restringidas ocupan una proporción ínfima de sus conjuntos de estrategias totales. [ 14 ]
Además, incluso si aún existe un equilibrio, este solo puede encontrarse mediante la búsqueda en el espacio de alta dimensión de todas las posibles funciones de la red neuronal. La estrategia estándar de usar el descenso de gradiente para encontrar el equilibrio a menudo no funciona para las GAN, y con frecuencia el juego "colapsa" en uno de varios modos de fallo. Para mejorar la estabilidad de la convergencia, algunas estrategias de entrenamiento comienzan con una tarea más sencilla, como generar imágenes de baja resolución [ 15 ] o imágenes simples (un objeto con fondo uniforme) [ 16 ] , y aumentan gradualmente la dificultad de la tarea durante el entrenamiento. Esto se traduce esencialmente en la aplicación de un esquema de aprendizaje curricular [ 17 ] .
Colapso de modo
Las GAN suelen sufrir colapso modal, donde no logran generalizar correctamente, omitiendo modos completos de los datos de entrada. Por ejemplo, una GAN entrenada con el conjunto de datos MNIST , que contiene muchas muestras de cada dígito, podría generar únicamente imágenes del dígito 0. Esto se denominó "el escenario Helvetica". [ 1 ]
Un mecanismo típico de colapso modal es que el generador solo produzca uno o pocos de los valores probables, o una imagen muy incompleta de la distribución objetivo. Dado que el discriminador solo está entrenado para distinguir muestras reales de falsas, identificará correctamente las muestras generadas como reales, pero no se impone ninguna penalización a la capacidad de la GAN para generar datos que representen el rango completo de la distribución objetivo.
Los discriminadores débiles, por ejemplo, los que están insuficientemente parametrizados o los que se entrenan demasiado lento en comparación con el generador, pueden ser incapaces de discriminar completamente en todo el rango de la distribución y solo ser capaces de discriminar correctamente una parte muy incompleta de la distribución objetivo.
Algunos investigadores consideran que el problema fundamental reside en una red discriminativa débil que no logra detectar el patrón de omisión, mientras que otros atribuyen la culpa a una mala elección de la función objetivo . Se han propuesto numerosas soluciones, pero sigue siendo un problema abierto. [ 18 ] [ 19 ]
Incluso la arquitectura de vanguardia, BigGAN (2019), no pudo evitar el colapso modal. Los autores recurrieron a "permitir que el colapso ocurriera en las etapas posteriores del entrenamiento, momento en el que un modelo está suficientemente entrenado para lograr buenos resultados". [ 20 ]
Regla de actualización de dos escalas de tiempo
La regla de actualización de dos escalas de tiempo (TTUR) se propone para lograr una convergencia más estable de las GAN al reducir la tasa de aprendizaje del generador con respecto a la del discriminador. Demuestran que, al entrenarse de esta manera, las GAN "convergen, bajo supuestos leves, a un equilibrio de Nash local estacionario". [ 21 ] Además, muestran que esta propiedad se extiende al uso del optimizador Adam, comúnmente utilizado en el descenso de gradiente estocástico.
Un equilibrio de Nash local no significa en absoluto la ausencia de colapso modal; por ejemplo, una GAN entrenada en MNIST que colapsa para generar un solo dígito puede satisfacer las hipótesis del artículo, al tiempo que presenta colapso modal.
Gradiente evanescente
Por el contrario, si el discriminador aprende demasiado rápido en comparación con el generador, entonces el discriminador podría distinguir casi perfectamenteEn tal caso, el generadorpodría quedar atrapado con una pérdida muy alta sin importar en qué dirección cambie su, lo que significa que el gradientesería cercano a cero. En tal caso, el generador no puede aprender, un caso del problema del gradiente evanescente . [ 14 ]
Intuitivamente hablando, el discriminador es demasiado bueno, y como el generador no puede dar ningún pequeño paso (solo se consideran pasos pequeños en el descenso de gradiente) para mejorar su resultado, ni siquiera lo intenta.
Un método importante para resolver este problema es la GAN de Wasserstein .
Evaluación
Las GAN se suelen evaluar mediante la puntuación Inception (IS), que mide la variabilidad de las salidas del generador (clasificadas por un clasificador de imágenes, normalmente Inception-v3 ), o la distancia Fréchet Inception (FID), que mide la similitud de las salidas del generador con un conjunto de referencia (clasificadas por un extractor de características de imagen aprendido, como Inception-v3 sin su capa final). Muchos artículos que proponen nuevas arquitecturas GAN para la generación de imágenes informan de cómo sus arquitecturas superan el estado del arte en FID o IS.
Otro método de evaluación es la similitud de parches de imagen perceptual aprendida (LPIPS), que comienza con un analizador de características de imagen aprendido.y lo ajusta mediante aprendizaje supervisado en un conjunto de, dóndees una imagen,es una versión perturbada de ella, yes cuánto difieren, según lo informado por sujetos humanos. El modelo está ajustado para que pueda aproximarseEste modelo ajustado se utiliza luego para definir. [ 22 ]
Otros métodos de evaluación se revisan en [ 23 ] .
Variantes
Existe un auténtico zoológico de variantes de GAN. [ 24 ] Algunas de las más destacadas son las siguientes:
GAN condicional
Las GAN condicionales son similares a las GAN estándar, con la diferencia de que permiten que el modelo genere muestras de forma condicional basándose en información adicional. Por ejemplo, si queremos generar la cara de un gato a partir de la imagen de un perro, podríamos usar una GAN condicional.
El generador en un juego GAN genera, una distribución de probabilidad en el espacio de probabilidad. Esto lleva a la idea de una GAN condicional, donde en lugar de generar una distribución de probabilidad enEl generador genera una distribución de probabilidad diferente.en, para cada etiqueta de clase dada.
Por ejemplo, para generar imágenes que se parezcan a ImageNet , el generador debería poder generar una imagen de un gato cuando se le proporcione la etiqueta de clase "cat".
En el artículo original, [ 1 ] los autores señalaron que GAN puede extenderse trivialmente a GAN condicional proporcionando las etiquetas tanto al generador como al discriminador.
Concretamente, el juego GAN condicional es simplemente el juego GAN con etiquetas de clase proporcionadas:dóndees una distribución de probabilidad sobre clases,es la distribución de probabilidad de imágenes reales de clase, yla distribución de probabilidad de las imágenes generadas por el generador cuando se le da una etiqueta de clase.
En 2017, una GAN condicional aprendió a generar 1000 clases de imágenes de ImageNet . [ 25 ]
GANs con arquitecturas alternativas
El juego GAN es un marco general y puede ejecutarse con cualquier parametrización razonable del generador.y discriminadorEn el artículo original, los autores lo demostraron utilizando redes perceptrón multicapa y redes neuronales convolucionales . Se han probado muchas arquitecturas alternativas.
GAN convolucional profunda (DCGAN): [ 26 ] Tanto para el generador como para el discriminador, utiliza únicamente redes profundas que consisten enteramente en capas de convolución-deconvolución, es decir, redes totalmente convolucionales. [ 27 ]
GAN de autoatención (SAGAN): [ 28 ] Comienza con la DCGAN, luego agrega módulos de autoatención estándar conectados residualmente al generador y al discriminador.
GAN autoencoder variacional (VAEGAN): [ 29 ] Utiliza un autoencoder variacional (VAE) para el generador.
Transformer GAN (TransGAN): [ 30 ] Utiliza la arquitectura de transformador puro tanto para el generador como para el discriminador, completamente desprovista de capas de convolución-deconvolución.
Flow-GAN: [ 31 ] Utiliza un modelo generativo basado en flujo para el generador, lo que permite un cálculo eficiente de la función de verosimilitud.
GANs con objetivos alternativos
Muchas variantes de GAN se obtienen simplemente cambiando las funciones de pérdida del generador y del discriminador.
GAN original:
Reformulamos el objetivo original de GAN en un formato más conveniente para la comparación:
GAN original, pérdida no saturante:
Este objetivo para el generador fue recomendado en el artículo original para una convergencia más rápida. [ 1 ]El efecto de utilizar este objetivo se analiza en la Sección 2.2.2 de Arjovsky et al. [ 32 ].
GAN original, máxima verosimilitud:
dóndees la función logística. Cuando el discriminador es óptimo, el gradiente del generador es el mismo que en la estimación de máxima verosimilitud , aunque GAN no puede realizar la estimación de máxima verosimilitud por sí mismo . [ 33 ] [ 34 ]
GAN con pérdida de bisagra : [ 35 ]GAN de mínimos cuadrados: [ 36 ]dóndeson parámetros a elegir. Los autores recomiendan.
Red generativa antagónica de Wasserstein (WGAN)
La GAN de Wasserstein modifica el juego GAN en dos puntos:
- El conjunto de estrategias del discriminador es el conjunto de funciones medibles de tipocon norma de Lipschitz acotada :, dóndees una constante positiva fija.
- El objetivo es
Uno de sus propósitos es resolver el problema del colapso de modos (ver arriba). [ 14 ] Los autores afirman: "En ningún experimento vimos evidencia de colapso de modos para el algoritmo WGAN".
GANs con más de dos jugadores
autoencoder adversario
Un autoencoder adversarial (AAE) [ 37 ] es más un autoencoder que una GAN. La idea es comenzar con un autoencoder simple , pero entrenar un discriminador para distinguir los vectores latentes de una distribución de referencia (a menudo la distribución normal).
InfoGAN
En GAN condicional, el generador recibe un vector de ruido.y una etiquetay produce una imagenEl discriminador recibe pares de imagen-etiqueta.y calcula.
Cuando el conjunto de datos de entrenamiento no está etiquetado, la GAN condicional no funciona directamente.
La idea de InfoGAN es decretar que cada vector latente en el espacio latente puede descomponerse como: una parte de ruido incompresibley una parte de etiqueta informativay alentar al generador a cumplir con el decreto, animándolo a maximizar, la información mutua entrey, sin exigir nada a cambio de información mutuaentre.
Desafortunadamente,es intratable en general. La idea clave de InfoGAN es la maximización de la información mutua variacional: [ 38 ] la maximiza indirectamente maximizando un límite inferior.dóndeabarca todos los núcleos de Markov de tipo.
El juego InfoGAN se define de la siguiente manera: [ 39 ]
Un juego InfoGAN se define mediante tres espacios de probabilidad:
- , el espacio de imágenes de referencia.
- , el generador de ruido aleatorio fijo.
- , el generador de información aleatoria fijo.
Hay 3 jugadores en 2 equipos: generador, Q y discriminador. El generador y Q están en un equipo, y el discriminador en el otro.
La función objetivo esdóndees el objetivo del juego GAN original, y
El equipo Generator-Q tiene como objetivo minimizar el objetivo, y el discriminador tiene como objetivo maximizarlo:
GAN bidireccional (BiGAN)
El generador GAN estándar es una función de tipo, es decir, es un mapeo desde un espacio latenteal espacio de la imagenEsto puede entenderse como un proceso de "decodificación", mediante el cual cada vector latentees un código para una imageny el generador realiza la decodificación. Esto lleva naturalmente a la idea de entrenar otra red que realice la "codificación", creando un autoencoder a partir del par codificador-generador.
Ya en el artículo original, [ 1 ] los autores señalaron que "La inferencia aproximada aprendida se puede realizar entrenando una red auxiliar para predecirdado"La arquitectura GAN bidireccional realiza precisamente esto. [ 40 ]
La BiGAN se define de la siguiente manera:
Un juego BiGAN se define mediante dos espacios de probabilidad:
- , el espacio de imágenes de referencia.
- , el espacio latente.
Hay 3 jugadores divididos en 2 equipos: generador, codificador y discriminador. El generador y el codificador están en un equipo, y el discriminador en el otro.
Las estrategias del generador son funcionesy las estrategias del codificador son funcionesLas estrategias del discriminador son funciones.
La función objetivo es
El equipo generador-codificador tiene como objetivo minimizar la función objetivo, y el discriminador tiene como objetivo maximizarla:
En el artículo, dieron una definición más abstracta del objetivo como:dóndees la distribución de probabilidad enobtenido al empujaravanzar por, yes la distribución de probabilidad enobtenido al empujaravanzar por.
Las aplicaciones de los modelos bidireccionales incluyen el aprendizaje semisupervisado , [ 41 ] el aprendizaje automático interpretable , [ 42 ] y la traducción automática neuronal . [ 43 ]
CycleGAN
CycleGAN es una arquitectura para realizar traducciones entre dos dominios, como por ejemplo entre fotos de caballos y fotos de cebras, o fotos de ciudades nocturnas y fotos de ciudades diurnas.
El juego CycleGAN se define de la siguiente manera: [ 44 ]
Hay dos espacios de probabilidad, correspondientes a los dos dominios necesarios para las traducciones de ida y vuelta.
Hay 4 jugadores en 2 equipos: generadoresy discriminadores.
La función objetivo es
dóndees un parámetro ajustable positivo,es el objetivo del juego GAN, yes la pérdida de consistencia del ciclo :Los generadores buscan minimizar la función objetivo, y los discriminadores buscan maximizarla:
A diferencia de trabajos anteriores como pix2pix, [ 45 ] que requieren datos de entrenamiento emparejados, cycleGAN no requiere datos emparejados. Por ejemplo, para entrenar un modelo pix2pix para convertir una foto de un paisaje veraniego en una foto de un paisaje invernal y viceversa, el conjunto de datos debe contener pares del mismo lugar en verano e invierno, tomadas desde el mismo ángulo; cycleGAN solo necesitaría un conjunto de fotos de paisajes veraniegos y un conjunto de fotos de paisajes invernales no relacionadas.
GANs con escalas particularmente grandes o pequeñas
BigGAN
BigGAN es esencialmente una GAN de autoatención entrenada a gran escala (hasta 80 millones de parámetros) para generar imágenes grandes de ImageNet (hasta una resolución de 512 x 512), con numerosos trucos de ingeniería para lograr su convergencia. [ 20 ] [ 46 ]
Aumento de datos invertible
Cuando no hay suficientes datos de entrenamiento, la distribución de referenciaLa distribución empírica proporcionada por el conjunto de datos de entrenamiento no puede aproximarse adecuadamente . En estos casos, se puede aplicar el aumento de datos para entrenar la GAN con conjuntos de datos más pequeños. Sin embargo, el aumento de datos ingenuo presenta sus propios problemas.
Consideremos el juego GAN original, ligeramente reformulado de la siguiente manera:Ahora utilizamos el aumento de datos mediante el muestreo aleatorio de transformaciones que preservan la semántica.y aplicándolas al conjunto de datos, para obtener el juego GAN reformulado:Esto es equivalente a un juego GAN con una distribución diferente., muestreado por, con. Por ejemplo, sies la distribución de imágenes en ImageNet, yLas muestras se transforman mediante la transformación identidad con una probabilidad de 0,5 y mediante la reflexión horizontal con una probabilidad de 0,5, luegoes la distribución de imágenes en ImageNet y ImageNet reflejada horizontalmente, combinadas.
El resultado de dicho entrenamiento sería un generador que imitaPor ejemplo, generaría imágenes que parecen recortadas aleatoriamente, si el aumento de datos utiliza recorte aleatorio.
La solución consiste en aplicar técnicas de aumento de datos tanto a las imágenes generadas como a las reales:Los autores demostraron una generación de alta calidad utilizando conjuntos de datos de tan solo 100 imágenes. [ 47 ]
El artículo StyleGAN-2-ADA señala otro punto sobre el aumento de datos: debe ser invertible . [ 48 ] Continuemos con el ejemplo de generar imágenes de ImageNet. Si el aumento de datos es "rotar aleatoriamente la imagen 0, 90, 180, 270 grados con igual probabilidad", entonces no hay forma de que el generador sepa cuál es la orientación verdadera: Consideremos dos generadores, de tal manera que para cualquier latente, la imagen generadaes una rotación de 90 grados deAmbas tendrían exactamente la misma pérdida esperada, por lo que ninguna es preferible a la otra.
La solución consiste en utilizar únicamente el aumento de datos invertible: en lugar de "rotar la imagen aleatoriamente 0, 90, 180 y 270 grados con igual probabilidad", utilice "rotar la imagen aleatoriamente 90, 180 y 270 grados con una probabilidad de 0,1 y mantener la imagen sin cambios con una probabilidad de 0,7". De esta forma, el generador sigue siendo recompensado por mantener las imágenes orientadas de la misma manera que las imágenes de ImageNet sin aumentar.
En abstracto, el efecto de las transformaciones de muestreo aleatoriode la distribuciónSe trata de definir un núcleo de Markov.Luego, el juego GAN con datos aumentados empuja al generador para encontrar algunos, de tal manera quedóndees la convolución del núcleo de Markov . Un método de aumento de datos se define como invertible si su núcleo de MarkovSatisfaceInmediatamente, por definición, vemos que la composición de múltiples métodos de aumento de datos invertibles da como resultado otro método invertible. También por definición, si el método de aumento de datos es invertible, entonces usarlo en un juego GAN no cambia la estrategia óptima.para el generador, que todavía está.
Existen dos ejemplos prototípicos de núcleos de Markov invertibles:
Caso discreto : Matrices estocásticas invertibles , cuandoes finito.
Por ejemplo, sies el conjunto de cuatro imágenes de una flecha, apuntando en 4 direcciones, y el aumento de datos es "rotar aleatoriamente la imagen 90, 180, 270 grados con probabilidady mantener la imagen tal como está con probabilidad", entonces el núcleo de Markovpuede representarse como una matriz estocástica:yes un núcleo invertible si y solo sies una matriz invertible, es decir,.
Caso continuo : El núcleo gaussiano, cuandopara algunos.
Por ejemplo, sies el espacio de imágenes de 256x256, y el método de aumento de datos es "generar un ruido gaussiano"., luego añadea la imagen", entonceses simplemente una convolución por la función de densidad de. Esto es invertible, porque la convolución por una gaussiana es simplemente la convolución por el núcleo de calor , por lo que dado cualquier, la distribución convolucionadase puede obtener calentandoprecisamente según, luego espera el tiempoCon eso, podemos recuperarnosal ejecutar la ecuación del calor hacia atrás en el tiempo para.
En el artículo se encuentran más ejemplos de aumentos de datos invertibles. [ 48 ]
SinGAN
SinGAN lleva el aumento de datos al límite, utilizando una sola imagen como datos de entrenamiento y aplicando el aumento de datos sobre ella. La arquitectura GAN se adapta a este método de entrenamiento mediante una canalización multiescala.
El generadorse descompone en una pirámide de generadores, siendo el más bajo el que genera la imagena la resolución más baja, luego la imagen generada se amplía ay se pasa al siguiente nivel para generar una imagen.a mayor resolución, y así sucesivamente. El discriminador también se descompone en una pirámide. [ 49 ]
Serie StyleGAN
La familia StyleGAN es una serie de arquitecturas publicadas por la división de investigación de Nvidia .
GAN progresiva
GAN progresiva [ 15 ] es un método para entrenar GAN para la generación de imágenes a gran escala de forma estable, haciendo crecer un generador GAN de pequeña a gran escala de forma piramidal. Al igual que SinGAN, descompone el generador comoy el discriminador como.
Durante el entrenamiento, al principio solose utilizan en un juego GAN para generar imágenes de 4x4.se añaden para llegar a la segunda etapa del juego GAN, para generar imágenes de 8x8, y así sucesivamente, hasta que llegamos a un juego GAN para generar imágenes de 1024x1024.
Para evitar choques entre las etapas del juego GAN, cada nueva capa se "integra" (Figura 2 del artículo [ 15 ] ). Por ejemplo, así es como comienza la segunda etapa del juego GAN:
- Justo antes, el juego GAN consta del parGeneración y discriminación de imágenes de 4x4.
- Justo después, el juego GAN consta del parGeneración y discriminación de imágenes de 8x8. Aquí, las funcionesson funciones de sobremuestreo y submuestreo de imágenes, yes un factor de fusión (muy parecido a un alfa en la composición de imágenes) que se desliza suavemente de 0 a 1.
StyleGAN-1

StyleGAN-1 está diseñado como una combinación de GAN progresiva con transferencia de estilo neuronal . [ 50 ]
La elección arquitectónica clave de StyleGAN-1 es un mecanismo de crecimiento progresivo, similar a Progressive GAN. Cada imagen generada comienza como una constanteEl array se pasa repetidamente a través de bloques de estilo. Cada bloque de estilo aplica un "vector latente de estilo" mediante una transformación afín ("normalización de instancia adaptativa"), de forma similar a como la transferencia de estilo neuronal utiliza la matriz de Gram . A continuación, se añade ruido y se normaliza (se resta la media y se divide por la varianza).
Durante el entrenamiento, normalmente solo se utiliza un vector latente de estilo por imagen generada, pero a veces dos ("regularización mixta") para animar a cada bloque de estilo a realizar su estilización de forma independiente sin esperar ayuda de otros bloques de estilo (ya que podrían recibir un vector latente de estilo completamente diferente).
Tras el entrenamiento, se pueden introducir múltiples vectores latentes de estilo en cada bloque de estilo. Los que se introducen en las capas inferiores controlan los estilos a gran escala, y los que se introducen en las capas superiores controlan los estilos de detalle fino.
Mezcla de estilos entre dos imágenesTambién se puede realizar. Primero, ejecute un descenso de gradiente para encontrarde tal manera queEsto se llama "proyectar una imagen de vuelta al espacio latente de estilo". Luego,se pueden alimentar a los bloques de estilo inferior, ya los bloques de estilo superior, para generar una imagen compuesta que tenga el estilo a gran escala dey el estilo de detalles finos deTambién se pueden componer varias imágenes de esta manera.
StyleGAN-2
StyleGAN-2 mejora StyleGAN-1, al usar el vector latente de estilo para transformar los pesos de la capa de convolución, resolviendo así el problema del "blob". [ 51 ]
Esto fue actualizado por StyleGAN-2-ADA ("ADA" significa "adaptativo"), [ 48 ] que utiliza aumento de datos invertible como se describió anteriormente. También ajusta la cantidad de aumento de datos aplicada comenzando en cero y aumentándola gradualmente hasta que una "heurística de sobreajuste" alcanza un nivel objetivo, de ahí el nombre "adaptativo".
StyleGAN-3
StyleGAN-3 [ 52 ] mejora StyleGAN-2 al resolver el problema de "adherencia de textura", que se puede ver en los videos oficiales. [ 53 ] Analizaron el problema mediante el teorema de muestreo de Nyquist-Shannon y argumentaron que las capas en el generador aprendieron a explotar la señal de alta frecuencia en los píxeles sobre los que operan.
Para solucionar esto, propusieron imponer filtros de paso bajo estrictos entre las capas de cada generador, de modo que este se vea obligado a operar sobre los píxeles de forma fiel a las señales continuas que representan, en lugar de tratarlos como señales discretas. Además, impusieron invariancia rotacional y traslacional mediante el uso de más filtros de señal . El StyleGAN-3 resultante es capaz de resolver el problema de la adherencia de texturas, así como de generar imágenes que rotan y se trasladan suavemente.
Otros usos
Además de para el modelado generativo y discriminativo de datos, las GAN se han utilizado para otras cosas.
Las GAN se han utilizado para el aprendizaje por transferencia con el fin de garantizar la alineación del espacio de características latentes, como en el aprendizaje por refuerzo profundo . [ 54 ] Esto funciona alimentando las incrustaciones de la tarea de origen y destino al discriminador, que intenta adivinar el contexto. La pérdida resultante se retropropaga (inversamente) a través del codificador.
Aplicaciones
Ciencia
- Reconstruir iterativamente imágenes astronómicas [ 55 ]
- Simular el efecto de lente gravitacional para la investigación de la materia oscura. [ 56 ] [ 57 ] [ 58 ]
- Modelar la distribución de materia oscura en una dirección particular del espacio y predecir la lente gravitacional que ocurrirá. [ 59 ] [ 60 ]
- Modelar la formación de chorros de alta energía [ 61 ] y cascadas a través de calorímetros de experimentos de física de alta energía . [ 62 ] [ 63 ] [ 64 ] [ 65 ]
- Cuellos de botella aproximados en simulaciones computacionalmente costosas de experimentos de física de partículas. Las aplicaciones en el contexto de los experimentos actuales y propuestos del CERN han demostrado el potencial de estos métodos para acelerar la simulación y/o mejorar la fidelidad de la simulación. [ 66 ] [ 67 ]
- Reconstruir los campos de velocidad y escalares en flujos turbulentos. [ 68 ] [ 69 ] [ 70 ]
Las moléculas generadas por GAN se validaron experimentalmente en ratones. [ 71 ] [ 72 ]
Médico
Una de las principales preocupaciones en la obtención de imágenes médicas es preservar la privacidad del paciente. Por este motivo, los investigadores suelen tener dificultades para obtener imágenes médicas para sus investigaciones. Las GAN se han utilizado para generar imágenes médicas sintéticas , como imágenes de resonancia magnética (RM) y tomografía por emisión de positrones (PET) , para abordar este problema. [ 73 ]
GAN puede utilizarse para detectar imágenes glaucomatosas , lo que ayuda al diagnóstico precoz, esencial para evitar la pérdida parcial o total de la visión. [ 74 ]
Las GAN se han utilizado para crear reconstrucciones faciales forenses de figuras históricas fallecidas. [ 75 ]
Malicioso


Se han planteado inquietudes sobre el posible uso de la síntesis de imágenes humanas basada en GAN para fines siniestros, por ejemplo, para producir fotografías y vídeos falsos, posiblemente incriminatorios. [ 76 ] Las GAN pueden utilizarse para generar fotos de perfil únicas y realistas de personas que no existen, con el fin de automatizar la creación de perfiles falsos en redes sociales. [ 77 ]
En 2019, el estado de California consideró [ 78 ] y aprobó el 3 de octubre de 2019 el proyecto de ley AB-602 , que prohíbe el uso de tecnologías de síntesis de imágenes humanas para crear pornografía falsa sin el consentimiento de las personas representadas, y el proyecto de ley AB-730 , que prohíbe la distribución de videos manipulados de un candidato político dentro de los 60 días previos a una elección. Ambos proyectos de ley fueron redactados por el asambleísta Marc Berman y firmados por el gobernador Gavin Newsom . Las leyes entraron en vigor en 2020. [ 79 ]
El programa de análisis forense de medios de DARPA estudia formas de contrarrestar los medios falsos, incluidos los producidos mediante GAN. [ 80 ]
Moda, arte y publicidad
Las GAN se pueden utilizar para generar arte; The Verge escribió en marzo de 2019 que "Las imágenes creadas por las GAN se han convertido en el aspecto definitorio del arte de IA contemporáneo". [ 81 ] Las GAN también se pueden utilizar para
- Fotografías retocadas [ 82 ]
- generar modelos de moda, [ 83 ] sombras, [ 84 ] renders fotorrealistas de diseño de interiores , diseño industrial , zapatos, etc. [ 85 ] Se informó que Facebook utilizaba tales redes . [ 86 ]
Algunos han trabajado con el uso de GAN para la creatividad artística, como "red adversaria creativa". [ 87 ] [ 88 ] Una GAN, entrenada con un conjunto de 15 000 retratos de WikiArt de los siglos XIV al XIX, creó la pintura Edmond de Belamy de 2018 , que se vendió por US$432 500. [ 89 ]
Las GAN fueron utilizadas por la comunidad de modificación de videojuegos para mejorar la resolución de texturas 2D de baja resolución en videojuegos antiguos, recreándolas en resoluciones 4k o superiores mediante entrenamiento de imágenes y luego reduciéndolas para que se ajustaran a la resolución nativa del juego (similar al antialiasing por supermuestreo ). [ 90 ]
En 2020, Artbreeder se utilizó para crear al antagonista principal de la secuela de la serie web de terror psicológico Ben Drowned . Posteriormente, el autor elogió las aplicaciones GAN por su capacidad para ayudar a generar recursos para artistas independientes con presupuestos y personal limitados. [ 91 ] [ 92 ]
En mayo de 2020, investigadores de Nvidia enseñaron a un sistema de IA (denominado "GameGAN") a recrear el juego Pac-Man simplemente observándolo jugar. [ 93 ] [ 94 ]
En agosto de 2019, se creó un gran conjunto de datos que consta de 12.197 canciones MIDI, cada una con letras y melodías emparejadas, para la generación de melodías neuronales a partir de letras utilizando GAN-LSTM condicional (consulte las fuentes en GitHub AI Melody Generation from Lyrics ). [ 95 ]
Misceláneas
Las GAN se han utilizado para
- mostrar cómo la apariencia de un individuo puede cambiar con la edad. [ 96 ]
- reconstruir modelos 3D de objetos a partir de imágenes , [ 97 ]
- generar objetos novedosos como nubes de puntos 3D, [ 98 ]
- modelar patrones de movimiento en video. [ 99 ]
- rellenar características faltantes en mapas, transferir estilos de mapas en cartografía [ 100 ] o aumentar imágenes de Street View. [ 101 ]
- utilizar la retroalimentación para generar imágenes y reemplazar los sistemas de búsqueda de imágenes. [ 102 ]
- Visualice el efecto que el cambio climático tendrá en casas específicas. [ 103 ]
- reconstruir una imagen del rostro de una persona después de escuchar su voz. [ 104 ]
- produce vídeos de una persona hablando, a partir de una sola foto de esa persona. [ 105 ]
- generación de secuencias recurrentes. [ 106 ]
Historia
En 1991, Juergen Schmidhuber publicó "Curiosidad artificial", redes neuronales en un juego de suma cero . [ 107 ] La primera red es un modelo generativo que modela una distribución de probabilidad sobre patrones de salida. La segunda red aprende mediante descenso de gradiente para predecir las reacciones del entorno a estos patrones. Las GAN pueden considerarse un caso en el que la reacción ambiental es 1 o 0 dependiendo de si la salida de la primera red está en un conjunto dado. [ 108 ]
Otras personas tuvieron ideas similares, pero no las desarrollaron de la misma manera. Una idea que involucraba redes antagónicas fue publicada en una entrada de blog de Olli Niemitalo en 2010. [ 109 ] Esta idea nunca se implementó y no incluía estocasticidad en el generador, por lo que no era un modelo generativo. Una idea similar a las GAN fue utilizada para modelar el comportamiento animal por Wei Li, Melvin Gauci y Roderich Gross en 2013. [ 110 ]
Otra inspiración para las GAN fue la estimación de contraste de ruido, [ 111 ] que utiliza la misma función de pérdida que las GAN y que Goodfellow estudió durante su doctorado en 2010-2014.
El aprendizaje automático adversario tiene otros usos además del modelado generativo y puede aplicarse a modelos distintos de las redes neuronales. En teoría de control, el aprendizaje adversario basado en redes neuronales se utilizó en 2006 para entrenar controladores robustos en un sentido de teoría de juegos, alternando las iteraciones entre una política minimizadora (el controlador) y una política maximizadora (la perturbación). [ 112 ] [ 113 ]
En 2017, se utilizó una GAN para la mejora de imágenes, centrándose en texturas realistas en lugar de la precisión de píxeles, lo que produjo una mayor calidad de imagen a gran aumento. [ 114 ] En 2017, se generaron los primeros rostros. [ 115 ] Estos se exhibieron en febrero de 2018 en el Grand Palais. [ 116 ] [ 117 ] Los rostros generados por StyleGAN [ 118 ] en 2019 generaron comparaciones con Deepfakes . [ 119 ] [ 120 ] [ 121 ]
Véase también
- arte de inteligencia artificial
- Deepfake : medios generados artificialmente con un realismo asombroso.
- Aprendizaje profundo : rama del aprendizaje automático
- Modelo de difusión : técnica para el modelado generativo de una distribución de probabilidad continua.
- Inteligencia artificial generativa : IA que genera contenido. Páginas que muestran descripciones breves de destinos de redireccionamiento.
- Medios sintéticos : producción artificial de medios mediante medios automatizados.
Referencias
- 1 2 3 4 5 6 7 8 9 10 Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). Generative Adversarial Nets (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 .
- ↑ Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi (2016). "Técnicas mejoradas para entrenar GANs". arXiv : 1606.03498 [ cs.LG ].
- ↑ Isola, Phillip; Zhu, Jun-Yan; Zhou, Tinghui; Efros, Alexei (2017). "Traducción de imagen a imagen con redes adversarias condicionales" . Visión por computadora y reconocimiento de patrones .
- ↑ Ho, Jonathon; Ermon, Stefano (2016). "Aprendizaje de imitación adversarial generativo" . Advances in Neural Information Processing Systems . 29 : 4565–4573 . arXiv : 1606.03476 .
- ↑ "Vanilla GAN (GANs en visión artificial: Introducción al aprendizaje generativo)" . theaisummer.com . AI Summer. 10 de abril de 2020. Archivado del original el 3 de junio de 2020. Consultado el 20 de septiembre de 2020 .
- ↑ Luc, Pauline; Couprie, Camille ; Chintala, Soumith; Verbeek, Jakob (25 de noviembre de 2016). "Segmentación semántica mediante redes adversarias". Taller NIPS sobre entrenamiento adversario, diciembre, Barcelona, España . 2016. arXiv : 1611.08408 .
- ↑ Andrej Karpathy ; Pieter Abbeel ; Greg Brockman; Peter Chen; Vicki Cheung; Rocky Duan; Ian Goodfellow; Durk Kingma; Jonathan Ho; Rein Houthooft; Tim Salimans; John Schulman; Ilya Sutskever; Wojciech Zaremba, Generative Models , OpenAI , consultado el 7 de abril de 2016
- ↑ Mohamed, Shakir; Lakshminarayanan, Balaji (2016). "Aprendizaje en modelos generativos implícitos". arXiv : 1610.03483 [ stat.ML ].
- ↑ Goodfellow, Ian (3 de abril de 2017). "Tutorial de NIPS 2016: Redes generativas adversarias". arXiv : 1701.00160 [ cs.LG ].
- ↑ Kingma, Diederik P.; Welling, Max (2019). "Una introducción a los autoencoders variacionales". Fundamentos y tendencias en aprendizaje automático . 12 (4): 307– 392. arXiv : 1906.02691 . doi : 10.1561/2200000056 .
- ↑ Kingma, Diederik P.; Welling, Max (1 de mayo de 2014). "Auto-Encoding Variational Bayes". arXiv : 1312.6114 [ stat.ML ].
- ↑Rezende, Danilo Jimenez; Mohamed, Shakir; Wierstra, Daan (2014). "Stochastic Backpropagation and Approximate Inference in Deep Generative Models". Journal of Machine Learning Research. 32 (2): 1278–1286. arXiv:1401.4082.
- 12Farnia, Farzan; Ozdaglar, Asuman (November 21, 2020). "Do GANs always have Nash equilibria?". Proceedings of the 37th International Conference on Machine Learning. Vol. 119. PMLR. pp. 3029–3039.
- 123Weng, Lilian (April 18, 2019). "From GAN to WGAN". arXiv:1904.08994 [cs.LG].
- 123Karras, Tero; Aila, Timo; Laine, Samuli; Lehtinen, Jaakko (October 1, 2017). "Progressive Growing of GANs for Improved Quality, Stability, and Variation". arXiv:1710.10196 [cs.NE].
- ↑Soviany, Petru; Ardei, Claudiu; Ionescu, Radu Tudor; Leordeanu, Marius (October 22, 2019). "Image Difficulty Curriculum for Generative Adversarial Networks (CuGAN)". arXiv:1910.08967 [cs.LG].
- ↑Hacohen, Guy; Weinshall, Daphna (May 24, 2019). "On The Power of Curriculum Learning in Training Deep Networks". International Conference on Machine Learning. PMLR: 2535–2544. arXiv:1904.03626.
- ↑Lin, Zinan; et al. (December 2018). PacGAN: the power of two samples in generative adversarial networks. 32nd International Conference on Neural Information Processing Systems. pp. 1505–1514. arXiv:1712.04086.
- ↑Mescheder, Lars; Geiger, Andreas; Nowozin, Sebastian (July 31, 2018). "Which Training Methods for GANs do actually Converge?". arXiv:1801.04406 [cs.LG].
- 12Brock, Andrew; Donahue, Jeff; Simonyan, Karen (September 1, 2018). Large Scale GAN Training for High Fidelity Natural Image Synthesis. International Conference on Learning Representations 2019. arXiv:1809.11096.
- ↑ Heusel, Martin; Ramsauer, Hubert; Unterthiner, Thomas; Nessler, Bernhard; Hochreiter, Sepp (2017). "GANs entrenadas mediante una regla de actualización de dos escalas de tiempo convergen a un equilibrio de Nash local" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. arXiv : 1706.08500 .
- ↑ Zhang, Richard; Isola, Phillip; Efros, Alexei A.; Shechtman, Eli; Wang, Oliver (2018). "La irrazonable efectividad de las características profundas como métrica perceptual". pp. 586– 595. arXiv : 1801.03924 [ cs.CV ].
- ↑ Borji, Ali (1 de febrero de 2019). "Ventajas y desventajas de las medidas de evaluación de GAN" . Computer Vision and Image Understanding . 179 : 41–65 . arXiv : 1802.03446 . Bibcode : 2019CVIU..179...41B . doi : 10.1016/j.cviu.2018.10.009 . ISSN 1077-3142 . S2CID 3627712 .
- ^ Hindupur, Avinash (15 de julio de 2022), The GAN Zoo , consultado el 15 de julio de 2022
- ↑ Odena, Augustus; Olah, Christopher; Shlens, Jonathon (17 de julio de 2017). "Síntesis condicional de imágenes con GANs de clasificadores auxiliares" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2642–2651 . arXiv : 1610.09585 .
- ↑ Radford, Alec; Metz, Luke; Chintala, Soumith (2016). "Aprendizaje de representación no supervisado con redes generativas adversarias convolucionales profundas". ICLR . S2CID 11758569 .
- ↑ Long, Jonathan; Shelhamer, Evan; Darrell, Trevor (2015). "Redes totalmente convolucionales para la segmentación semántica" . CVF : 3431–3440 .
- ↑ Zhang, Han; Goodfellow, Ian; Metaxas, Dimitris; Odena, Augustus (24 de mayo de 2019). "Redes generativas adversarias de autoatención" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 7354–7363 .
- ^ Larsen, Anders Boesen Lindbo; Sønderby, Søren Kaae; Larochelle, Hugo; Winther, Ole (11 de junio de 2016). "Codificación automática más allá de los píxeles utilizando una métrica de similitud aprendida" . Congreso Internacional sobre Aprendizaje Automático . PMLR: 1558–1566 . arXiv : 1512.09300 .
- ↑ Jiang, Yifan; Chang, Shiyu; Wang, Zhangyang (8 de diciembre de 2021). "TransGAN: Dos transformadores puros pueden crear una GAN fuerte y escalable". arXiv : 2102.07074 [ cs.CV ].
- ↑ Grover, Aditya; Dhar, Manik; Ermon, Stefano (1 de mayo de 2017). "Flow-GAN: Combinando máxima verosimilitud y aprendizaje adversario en modelos generativos". arXiv : 1705.08868 [ cs.LG ].
- ↑ Arjovsky, Martin; Bottou, Léon (1 de enero de 2017). "Hacia métodos basados en principios para el entrenamiento de redes generativas adversarias". arXiv : 1701.04862 [ stat.ML ].
- ↑ Goodfellow, Ian J. (1 de diciembre de 2014). "Sobre los criterios de distinguibilidad para estimar modelos generativos". arXiv : 1412.6515 [ stat.ML ].
- ↑ Goodfellow, Ian (31 de agosto de 2016). "Redes generativas antagónicas (GAN), presentación en el Laboratorio de Inteligencia Artificial de Berkeley" (PDF) . Archivado (PDF) del original el 8 de mayo de 2022.
- ↑ Lim, Jae Hyun; Ye, Jong Chul (8 de mayo de 2017). "GAN geométrica". arXiv : 1705.02894 [ estad.ML ].
- ↑ Mao, Xudong; Li, Qing; Xie, Haoran; Lau, Raymond YK; Wang, Zhen; Paul Smolley, Stephen (2017). "Redes generativas adversarias de mínimos cuadrados" . 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 2794–2802 . arXiv : 1611.04076 . doi : 10.1109/ICCV.2017.304 . ISBN 978-1-5386-1032-9.
- ↑ Makhzani, Alireza; Shlens, Jonathon; Jaitly, Navdeep; Goodfellow, Ian ; Frey, Brendan (2016). "Autoencoders adversariales". arXiv : 1511.05644 [ cs.LG ].
- ↑ Barber, David; Agakov, Felix (9 de diciembre de 2003). "El algoritmo IM: un enfoque variacional para la maximización de la información" . Actas de la 16.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'03. Cambridge, MA, EE. UU.: MIT Press: 201–208 .
- ↑ Chen, Xi; Duan, Yan; Houthooft, Rein; Schulman, John; Sutskever, Ilya; Abbeel, Pieter (2016). "InfoGAN: Aprendizaje de representación interpretable mediante redes generativas adversarias que maximizan la información" . Advances in Neural Information Processing Systems . 29. Curran Associates, Inc. arXiv : 1606.03657 .
- ^ Donahue, Jeff; Krähenbühl, Philipp; Darrell, Trevor (2016). "Aprendizaje de funciones adversas". arXiv : 1605.09782 [ cs.LG ].
- ↑ Dumoulin, Vincent; Belghazi, Ishmael; Poole, Ben; Mastropietro, Olivier; Arjovsky, Alex; Courville, Aaron (2016). "Inferencia aprendida adversariamente". arXiv : 1606.00704 [ stat.ML ].
- ↑ Xi Chen; Yan Duan; Rein Houthooft; John Schulman; Ilya Sutskever ; Pieter Abeel (2016). "InfoGAN: Aprendizaje de representación interpretable mediante redes generativas adversarias que maximizan la información". arXiv : 1606.03657 [ cs.LG ].
- ↑ Zhirui Zhang; Shujie Liu; Mu Li; Ming Zhou; Enhong Chen (octubre de 2018). "Redes generativas adversarias bidireccionales para la traducción automática neuronal" (PDF) . págs. 190–199 .
- ↑ Zhu, Jun-Yan; Park, Taesung; Isola, Phillip; Efros, Alexei A. (2017). "Traducción de imagen a imagen sin pares mediante redes adversarias con consistencia cíclica". pp. 2223– 2232. arXiv : 1703.10593 [ cs.CV ].
- ↑ Isola, Phillip; Zhu, Jun-Yan; Zhou, Tinghui; Efros, Alexei A. (2017). "Traducción de imagen a imagen con redes adversarias condicionales". pp. 1125– 1134. arXiv : 1611.07004 [ cs.CV ].
- ↑ Brownlee, Jason (22 de agosto de 2019). "Una introducción sencilla a BigGAN, la gran red generativa antagónica" . Machine Learning Mastery . Recuperado el 15 de julio de 2022 .
- ↑ Shengyu, Zhao; Zhijian, Liu; Ji, Lin; Jun-Yan, Zhu; Song, Han (2020). " Aumento diferenciable para el entrenamiento eficiente de GAN con datos" . Advances in Neural Information Processing Systems . 33. arXiv : 2006.10738 .
- 1 2 3 Tero, Karras; Miika, Aittala; Janne, Hellsten; Samuli, Laine; Jaakko, Lehtinen; Timo, Aila (2020). "Capacitación de redes generativas adversarias con datos limitados" . Avances en los sistemas de procesamiento de información neuronal . 33 .
- ↑ Shaham, Tamar Rott; Dekel, Tali; Michaeli, Tomer (octubre de 2019). "SinGAN: Aprendizaje de un modelo generativo a partir de una sola imagen natural" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 4569–4579 . arXiv : 1905.01164 . doi : 10.1109/iccv.2019.00467 . ISBN 978-1-7281-4803-8. S2CID 145052179 .
- ↑ Karras, Tero; Laine, Samuli; Aila, Timo (junio de 2019). "Una arquitectura de generador basada en estilos para redes generativas adversarias" . Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 4396–4405 . arXiv : 1812.04948 . doi : 10.1109/cvpr.2019.00453 . ISBN 978-1-7281-3293-8. S2CID 54482423 .
- ↑ Karras, Tero; Laine, Samuli; Aittala, Miika; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo (junio de 2020). "Análisis y mejora de la calidad de imagen de StyleGAN" . Conferencia IEEE/CVF 2020 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 8107–8116 . arXiv : 1912.04958 . doi : 10.1109/cvpr42600.2020.00813 . ISBN 978-1-7281-7168-5. S2CID 209202273 .
- ↑ Timo, Karras, Tero Aittala, Miika Laine, Samuli Härkönen, Erik Hellsten, Janne Lehtinen, Jaakko Aila (23 de junio de 2021). Redes adversarias generativas sin alias . OCLC 1269560084 .
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Karras, Tero; Aittala, Miika; Laine, Samuli; Härkönen, Erik; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo. "Redes adversarias generativas sin alias (StyleGAN3)" . nvlabs.github.io . Consultado el 16 de julio de 2022 .
- ^ Li, Bonnie; François-Lavet, Vicente; Doan, Thang; Pineau, Joelle (14 de febrero de 2021). "Aprendizaje por refuerzo de dominio adversario". arXiv : 2102.07097 [ cs.LG ].
- ↑ Schawinski, Kevin; Zhang, Ce; Zhang, Hantian; Fowler, Lucas; Santhanam, Gokula Krishnan (1 de febrero de 2017). "Las redes generativas adversarias recuperan características en imágenes astrofísicas de galaxias más allá del límite de deconvolución" . Monthly Notices of the Royal Astronomical Society: Letters . 467 (1): L110– L114. arXiv : 1702.00403 . Bibcode : 2017MNRAS.467L.110S . doi : 10.1093/mnrasl/slx008 . S2CID 7213940 .
- ↑ Kincade, Kathy. "Investigadores entrenan una red neuronal para estudiar la materia oscura" . Revista R&D.
- ↑ Kincade, Kathy (16 de mayo de 2019). "CosmoGAN: Entrenamiento de una red neuronal para estudiar la materia oscura" . Phys.org .
- ↑ "Entrenamiento de una red neuronal para estudiar la materia oscura" . Science Daily . 16 de mayo de 2019.
- ↑ a las 06:13, Katyanna Quach, 20 de mayo de 2019. "Los cosmopolitas usan redes neuronales para construir mapas de materia oscura de forma sencilla" . www.theregister.co.uk . Consultado el 20 de mayo de 2019 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Mustafa, Mustafa; Bard, Deborah; Bhimji, Wahid; Lukić, Zarija; Al-Rfou, Rami; Kratochvil, Jan M. (6 de mayo de 2019). "CosmoGAN: creación de mapas de convergencia de lentes débiles de alta fidelidad mediante redes generativas adversarias" . Astrofísica computacional y cosmología . 6 (1) 1. arXiv : 1706.02390 . Bibcode : 2019ComAC...6....1M . doi : 10.1186/s40668-019-0029-9 . ISSN 2197-7909 . S2CID 126034204 .
- ↑ Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2017). "Aprendizaje de física de partículas mediante ejemplos: redes generativas adversarias con conciencia de la ubicación para la síntesis de física". Computing and Software for Big Science . 1 (1): 4. arXiv : 1701.05927 . Bibcode : 2017CSBS....1....4D . doi : 10.1007/s41781-017-0004-6 . S2CID 88514467 .
- ↑ Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2018). "Acelerando la ciencia con redes generativas adversarias: una aplicación a cascadas de partículas 3D en calorímetros multicapa". Physical Review Letters . 120 (4) 042003. arXiv : 1705.02355 . Bibcode : 2018PhRvL.120d2003P . doi : 10.1103/PhysRevLett.120.042003 . PMID 29437460 . S2CID 3330974 .
- ↑ Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2018). "CaloGAN: Simulación de cascadas de partículas de alta energía en 3D en calorímetros electromagnéticos multicapa con redes generativas adversarias". Phys. Rev. D . 97 (1) 014021. arXiv : 1712.10321 . Bibcode : 2018PhRvD..97a4021P . doi : 10.1103/PhysRevD.97.014021 . S2CID 41265836 .
- ↑ Erdmann, Martin; Glombitza, Jonas; Quast, Thorben (2019). "Simulación precisa de cascadas de calorímetros electromagnéticos utilizando una red generativa adversaria de Wasserstein". Computing and Software for Big Science . 3 (1): 4. arXiv : 1807.01954 . Bibcode : 2019CSBS....3....4E . doi : 10.1007/s41781-018-0019-7 . S2CID 54216502 .
- ↑ Musella, Pasquale; Pandolfi, Francesco (2018). "Simulación rápida y precisa de detectores de partículas mediante redes generativas adversarias". Computing and Software for Big Science . 2 (1): 8. arXiv : 1805.00850 . Bibcode : 2018CSBS....2....8M . doi : 10.1007/s41781-018-0015-y . S2CID 119474793 .
- ↑ "Modelos generativos profundos para la simulación rápida de cascadas en ATLAS" . 2018.
- ↑ SHiP, Colaboración (2019). "Simulación rápida de muones producidos en el experimento SHiP utilizando redes generativas adversarias". Journal of Instrumentation . 14 (11) 11028. arXiv : 1909.04451 . Bibcode : 2019JInst..14P1028A . doi : 10.1088/1748-0221/14/11/P11028 . S2CID 202542604 .
- ↑ Nista, Ludovico; Pitsch, Heinz; Schumann, Christoph DK; Bode, Mathis; Grenga, Temistocle; MacArt, Jonathan F.; Attili, Antonio (4 de junio de 2024). "Influencia del entrenamiento adversario en la reconstrucción de turbulencia de superresolución" . Physical Review Fluids . 9 (6) 064601. arXiv : 2308.16015 . Bibcode : 2024PhRvF...9f4601N . doi : 10.1103/PhysRevFluids.9.064601 .
- ↑ Nista, L.; Schumann, CDK; Grenga, T.; Attili, A.; Pitsch, H. (1 de enero de 2023). "Investigación de la capacidad de generalización de una red generativa adversaria para la simulación de grandes remolinos de flujos reactivos premezclados turbulentos" . Actas del Instituto de Combustión . 39 (4): 5279– 5288. Bibcode : 2023PComI..39.5279N . doi : 10.1016/j.proci.2022.07.244 . hdl : 20.500.11820/d36801a4-ead5-4379-92a4-020a509112ec . ISSN 1540-7489 .
- ↑ Fukami, Kai; Fukagata, Koji; Taira, Kunihiko (1 de agosto de 2020). "Evaluación de métodos de aprendizaje automático supervisado para flujos de fluidos". Dinámica de fluidos teórica y computacional . 34 (4): 497– 519. arXiv : 2001.09618 . Bibcode : 2020ThCFD..34..497F . doi : 10.1007/s00162-020-00518-y . ISSN 1432-2250 .
- ↑ Zhavoronkov, Alex (2019). "El aprendizaje profundo permite la identificación rápida de potentes inhibidores de la quinasa DDR1". Nature Biotechnology . 37 (9): 1038– 1040. doi : 10.1038/s41587-019-0224-x . PMID 31477924 . S2CID 201716327 .
- ↑ Barber, Gregory. "Una molécula diseñada por IA exhibe cualidades "similares a las de un fármaco" . Wired .
- ↑ Moradi, M; Demirel, H (2024). "Clasificación de la enfermedad de Alzheimer mediante selección de datos basada en GAN condicional progresiva 3D y LDA". Procesamiento de señales, imágenes y vídeo . 18 (2): 1847– 1861. doi : 10.1007/s11760-023-02878-4 .
- ↑ Bisneto, Tomaz Ribeiro Viana; de Carvalho Filho, Antonio Oseas; Magalhães, Deborah Maria Vieira (febrero de 2020). "Características de textura y red adversaria generativa aplicadas a la detección automática de glaucoma". Computación blanda aplicada . 90 106165.doi : 10.1016/ j.asoc.2020.106165 . S2CID 214571484 .
- ↑ Reconstrucción de los emperadores romanos: Entrevista con Daniel Voshart , 16 de noviembre de 2020 , consultado el 3 de junio de 2022
- ↑ msmash (14 de febrero de 2019).El sitio web 'This Person Does Not Exist' utiliza IA para crear rostros realistas pero aterradores . Slashdot . Consultado el 16 de febrero de 2019 .
- ↑ Doyle, Michael (16 de mayo de 2019). "John Beasley vive en Saddlehorse Drive en Evansville. ¿O no?" . Courier and Press.
- ↑ Targett, Ed (16 de mayo de 2019). "California se acerca a ilegalizar la pornografía deepfake". Computer Business Review.
- ↑ Mihalcik, Carrie (4 de octubre de 2019). "Las leyes de California buscan reprimir los deepfakes en la política y la pornografía" . cnet.com . CNET . Consultado el 13 de octubre de 2019 .
- ↑ Knight, Will (7 de agosto de 2018). "El Departamento de Defensa ha producido las primeras herramientas para detectar deepfakes" . MIT Technology Review .
- ↑ Vincent, James (5 de marzo de 2019). "Un flujo interminable de arte creado con IA sale a subasta" . The Verge . Consultado el 13 de junio de 2020 .
- ↑ Yu, Jiahui, et al. " Relleno de imágenes generativo con atención contextual ". Actas de la conferencia IEEE sobre visión por computadora y reconocimiento de patrones. 2018.
- ↑ Wong, Ceecee (27 de mayo de 2019). "El auge de las supermodelos de IA" . CDO Trends .
- ↑ Taif, K.; Ugail, H.; Mehmood, I. (2020). "Generación de sombras proyectadas mediante redes generativas adversarias". Ciencia Computacional – ICCS 2020. Notas de clase en Ciencias de la Computación. Vol. 12141. pp. 481–495 . doi : 10.1007/978-3-030-50426-7_36 . ISBN 978-3-030-50425-0. PMC 7302543 .
- ↑ Wei, Jerry (3 de julio de 2019). "Generación de diseños de zapatos con aprendizaje automático" . Medium . Archivado del original el 30 de abril de 2020. Recuperado el 6 de noviembre de 2019 .
- ↑ Greenemeier, Larry (20 de junio de 2016). "¿Cuándo tendrán sentido común las computadoras? Pregúntenle a Facebook" . Scientific American . Recuperado el 31 de julio de 2016 .
- ↑ Elgammal, Ahmed; Liu, Bingchen; Elhoseiny, Mohamed; Mazzone, Marian (2017). "CAN: Creative Adversarial Networks, Generating "Art" by Learning About Styles and Deviating from Style Norms". arXiv : 1706.07068 [ cs.AI ].
- ↑ Mazzone, Marian; Ahmed Elgammal (21 de febrero de 2019). "Arte, creatividad y el potencial de la inteligencia artificial" . Arts . 8 : 26. doi : 10.3390/arts8010026 .
- ↑ Cohn, Gabe (25 de octubre de 2018). "Arte con IA en Christie's se vende por 432.500 dólares" . The New York Times .
- ^ Tang, Xiaoou; Qiao, Yu; Loy, Chen Cambio; Dong, Chao; Liu, Yihao; Gu, Jinjin; Wu, Shixiang; Yu, Ke; Wang, Xintao (1 de septiembre de 2018). "ESRGAN: redes adversas generativas de superresolución mejoradas". arXiv : 1809.00219 [ cs.CV ].
- ↑ Allen, Eric Van (8 de julio de 2020). "Una infame saga de creepypastas de Zelda utiliza inteligencia artificial para crear su final" . USgamer . Archivado del original el 7 de noviembre de 2022. Recuperado el 7 de noviembre de 2022 .
- ↑ arcadeattack (28 de septiembre de 2020). "Arcade Attack Podcast – Septiembre (4 de 4) 2020 - Alex Hall (Ben Drowned) - Entrevista" . Arcade Attack . Consultado el 7 de noviembre de 2022 .
- ↑ "La IA de Nvidia recrea Pac-Man desde cero con solo observar cómo se juega" . The Verge . 22 de mayo de 2020.
- ↑ Seung Wook Kim; Zhou, Yuhao; Philion, Jonah; Torralba, Antonio; Fidler, Sanja (2020). "Aprendizaje para simular entornos dinámicos con GameGAN". arXiv : 2005.12126 [ cs.CV ].
- ↑ Yu, Yi; Canales, Simon (2021). "LSTM-GAN condicional para la generación de melodías a partir de letras". ACM Transactions on Multimedia Computing, Communications, and Applications . 17 : 1–20 . arXiv : 1908.05551 . doi : 10.1145/3424116 . ISSN 1551-6857 . S2CID 199668828 .
- ↑ Antipov, Grigory; Baccouche, Moez; Dugelay, Jean-Luc (2017). "Envejecimiento facial con redes generativas adversarias condicionales". arXiv : 1702.01983 [ cs.CV ].
- ↑ "Red Generativa Adversaria 3D" . 3dgan.csail.mit.edu .
- ↑ Achlioptas, Panos; Diamanti, Olga; Mitliagkas, Ioannis; Guibas, Leonidas (2018). "Aprendizaje de representaciones y modelos generativos para nubes de puntos 3D". arXiv : 1707.02392 [ cs.CV ].
- ↑ Vondrick, Carl; Pirsiavash, Hamed; Torralba, Antonio (2016). "Generación de vídeos con dinámica de escena" . carlvondrick.com . arXiv : 1609.02612 . Bibcode : 2016arXiv160902612V .
- ↑ Kang, Yuhao; Gao, Song; Roth, Rob (2019). "Transferencia de estilos de mapas multiescala mediante redes generativas adversarias" . Revista Internacional de Cartografía . 5 ( 2–3 ): 115–141 . arXiv : 1905.02200 . Bibcode : 2019IJCar...5..115K . doi : 10.1080/23729333.2019.1615729 . S2CID 146808465 .
- ↑ Wijnands, Jasper; Nice, Kerry; Thompson, Jason; Zhao, Haifeng; Stevenson, Mark (2019). "Aumento del paisaje urbano mediante redes generativas adversarias: perspectivas relacionadas con la salud y el bienestar". Sustainable Cities and Society . 49 101602. arXiv : 1905.06464 . Bibcode : 2019SusCS..4901602W . doi : 10.1016/j.scs.2019.101602 . S2CID 155100183 .
- ↑ Ukkonen, Antti; Joona, Pyry; Ruotsalo, Tuukka (2020). "Generando imágenes en lugar de recuperarlas" . Actas de la 43.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . págs. 1329–1338 . doi : 10.1145/3397271.3401129 . hdl : 10138/328471 . ISBN 978-1-4503-8016-4. S2CID 220730163 .
- ↑ "La IA puede mostrarnos los estragos del cambio climático" . MIT Technology Review . 16 de mayo de 2019.
- ↑ Christian, Jon (28 de mayo de 2019). "ASOMBROSA IA ADIVINA TU APARIENCIA BASÁNDOSE EN TU VOZ" . Futurismo.
- ↑ Kulp, Patrick (23 de mayo de 2019). "El laboratorio de IA de Samsung puede crear imágenes de vídeo falsas a partir de una sola foto de la cabeza" . AdWeek .
- ↑ Mohammad Navid Fekri; Ananda Mohon Ghosh; Katarina Grolinger (2020). "Generación de datos energéticos para aprendizaje automático con redes generativas adversarias recurrentes" . Energies . 13 (1): 130. doi : 10.3390/en13010130 .
- ↑ Schmidhuber, Jürgen (1991). "Una posibilidad para implementar la curiosidad y el aburrimiento en controladores neuronales de modelado". Proc. SAB'1991 . MIT Press/Bradford Books. pp. 222–227 .
- ↑ Schmidhuber, Jürgen (2020). "Las redes generativas adversarias son casos especiales de curiosidad artificial (1990) y también están estrechamente relacionadas con la minimización de la predictibilidad (1991)". Redes neuronales . 127 : 58–66 . arXiv : 1906.04493 . doi : 10.1016/j.neunet.2020.04.008 . PMID 32334341. S2CID 216056336 .
- ↑ Niemitalo, Olli (24 de febrero de 2010). "Un método para entrenar redes neuronales artificiales para generar datos faltantes dentro de un contexto variable" . Internet Archive (Wayback Machine) . Archivado del original el 12 de marzo de 2012. Recuperado el 22 de febrero de 2019 .
- ↑ Li, Wei; Gauci, Melvin; Gross, Roderich (6 de julio de 2013). «Actas de la decimoquinta conferencia anual sobre computación genética y evolutiva - GECCO '13». Actas de la 15.ª Conferencia Anual sobre Computación Genética y Evolutiva (GECCO 2013) . Ámsterdam, Países Bajos: ACM. págs. 223-230 . doi : 10.1145/2463372.2465801 . ISBN 978-1-4503-1963-8.
- ↑ Gutmann, Michael; Hyvärinen, Aapo. "Estimación de contraste de ruido" (PDF) . Conferencia internacional sobre IA y estadística .
- ↑ Abu-Khalaf, Murad; Lewis, Frank L.; Huang, Jie (1 de julio de 2008). "Programación neurodinámica y juegos de suma cero para sistemas de control con restricciones". IEEE Transactions on Neural Networks . 19 (7): 1243– 1252. Bibcode : 2008ITNN...19.1243A . doi : 10.1109/TNN.2008.2000204 . S2CID 15680448 .
- ↑ Abu-Khalaf, Murad; Lewis, Frank L.; Huang, Jie (1 de diciembre de 2006). "Iteraciones de política en la ecuación de Hamilton-Jacobi-Isaacs para el control de retroalimentación de estado H ∞ con saturación de entrada". IEEE Transactions on Automatic Control . doi : 10.1109/TAC.2006.884959 . S2CID 1338976 .
- ↑ Sajjadi, Mehdi SM; Schölkopf, Bernhard; Hirsch, Michael (23 de diciembre de 2016). "EnhanceNet: Superresolución de imagen única mediante síntesis de textura automatizada". arXiv : 1612.07919 [ cs.CV ].
- ↑ "Esta persona no existe: con la IA, nada existirá eventualmente" . 20 de marzo de 2019.
- ↑ "La inteligencia artificial entra en la historia del arte" . 28 de diciembre de 2018.
- ↑ Tom Février (17 de febrero de 2019). "El escándalo de la inteligencia ARTificielle" .
- ↑ "StyleGAN: Implementación oficial de TensorFlow" . 2 de marzo de 2019 – vía GitHub.
- ↑ Paez, Danny (13 de febrero de 2019). "This Person Does Not Exist Is the Best One-Off Website of 2019" . Recuperado el 16 de febrero de 2019 .
- ↑ Beschizza, Rob (15 de febrero de 2019). "Esta persona no existe" . Boing-Boing . Consultado el 16 de febrero de 2019 .
- ↑ Horev, Rani (26 de diciembre de 2018). "GAN basadas en estilos: generación y ajuste de rostros artificiales realistas" . Lyrn.AI. Archivado del original el 5 de noviembre de 2020. Recuperado el 16 de febrero de 2019 .
Enlaces externos
- Knight, Will. "5 grandes predicciones para la inteligencia artificial en 2017" . MIT Technology Review . Consultado el 5 de enero de 2017 .
- Karras, Tero; Laine, Samuli; Aila, Timo (2018). "Una arquitectura de generador basada en estilos para redes generativas adversarias". arXiv : 1812.04948 [ cs.NE ].
- Esta persona no existe : imágenes fotorrealistas de personas que no existen, generadas por StyleGAN.
- Este gato no existe. Archivado el 5 de marzo de 2019 en Wayback Machine : imágenes fotorrealistas de gatos que no existen, generadas por StyleGAN.
- Wang, Zhengwei; She, Qi; Ward, Tomas E. (2019). "Redes generativas adversarias en visión por computadora: una revisión y taxonomía". arXiv : 1906.01529 [ cs.LG ].
- Arquitecturas de redes neuronales
- Ciencia cognitiva
- Aprendizaje no supervisado
- IA generativa
- 2014 en inteligencia artificial