Articulo de referencia

Red generativa antagónica

Una ilustración de cómo funciona una GAN. Una red generativa antagónica ( GAN ) es una clase de marcos de aprendizaje automático y un marco destacado para abordar la inteligenci...

Una ilustración de cómo funciona una GAN.

Una red generativa antagónica ( GAN ) es una clase de marcos de aprendizaje automático y un marco destacado para abordar la inteligencia artificial generativa . El concepto fue desarrollado inicialmente por Ian Goodfellow y sus colegas en junio de 2014. [ 1 ] En una GAN, dos redes neuronales compiten entre sí en forma de un juego de suma cero , donde la ganancia de un agente es la pérdida de otro.

Dado un conjunto de entrenamiento, esta técnica aprende a generar nuevos datos con las mismas estadísticas que el conjunto de entrenamiento. Por ejemplo, una GAN entrenada con fotografías puede generar nuevas fotografías que parezcan, al menos superficialmente, auténticas para los observadores humanos, con muchas características realistas. Aunque originalmente se propuso como una forma de modelo generativo para el aprendizaje no supervisado , las GAN también han demostrado ser útiles para el aprendizaje semisupervisado , [ 2 ] el aprendizaje totalmente supervisado [ 3 ] y el aprendizaje por refuerzo . [ 4 ]

La idea central de una GAN se basa en el entrenamiento "indirecto" a través del discriminador, otra red neuronal que puede determinar cuán "realista" parece la entrada, la cual también se actualiza dinámicamente. [ 5 ] Esto significa que el generador no se entrena para minimizar la distancia a una imagen específica, sino para engañar al discriminador. Esto permite que el modelo aprenda de forma no supervisada.

Las GAN son similares al mimetismo en la biología evolutiva , con una carrera armamentística evolutiva entre ambas redes.

Definición

Matemático

La GAN original se define como el siguiente juego : [ 1 ]

Cada espacio de probabilidad(Ω,μárbitro){\displaystyle (\Omega ,\mu _{\text{ref}})}define un juego GAN.

Hay dos jugadores: generador y discriminador.

El conjunto de estrategias del generador esPAG(Ω){\displaystyle {\mathcal {P}}(\Omega)}, el conjunto de todas las medidas de probabilidadμGRAMO{\displaystyle \mu _{G}}enΩ{\displaystyle \Omega }.

El conjunto de estrategias del discriminador es el conjunto de núcleos de Markov.μD:ΩPAG[0,1]{\displaystyle \mu _{D}:\Omega \to {\mathcal {P}}[0,1]}, dóndePAG[0,1]{\displaystyle {\mathcal {P}}[0,1]}es el conjunto de medidas de probabilidad en[0,1]{\displaystyle [0,1]}.

El juego GAN es un juego de suma cero , con función objetivoL(μGRAMO,μD):=miincógnitaμárbitro,yμD(incógnita)[lny]+miincógnitaμGRAMO,yμD(incógnita)[ln(1y)].{\displaystyle L(\mu _{G},\mu _{D}):=\operatorname {E} _{x\sim \mu _{\text{ref}},y\sim \mu _{D}(x)}[\ln y]+\operatorname {E} _{x\sim \mu _{G},y\sim \mu _{D}(x)}[\ln(1-y)].} El generador tiene como objetivo minimizar la función objetivo, y el discriminador tiene como objetivo maximizar la función objetivo.

La tarea del generador es acercarseμGRAMOμárbitro{\displaystyle \mu _{G}\approx \mu _{\text{ref}}}Es decir, ajustar su propia distribución de salida lo más posible a la distribución de referencia. La tarea del discriminador es generar un valor cercano a 1 cuando la entrada parece provenir de la distribución de referencia, y un valor cercano a 0 cuando la entrada parece provenir de la distribución del generador.

En la práctica

La red generativa genera candidatos mientras que la red discriminativa los evalúa. [ 1 ] Esto crea una competencia basada en distribuciones de datos, donde el generador aprende a mapear desde un espacio latente a la distribución de datos real, con el objetivo de producir candidatos que el discriminador no pueda distinguir de los datos reales. El objetivo del discriminador es identificar correctamente estos candidatos, pero a medida que el generador mejora, su tarea se vuelve más desafiante, aumentando la tasa de error del discriminador. [ 1 ] [ 6 ]

Un conjunto de datos conocido sirve como datos de entrenamiento inicial para el discriminador. El entrenamiento implica presentarle muestras del conjunto de datos de entrenamiento hasta que alcance una precisión aceptable. El generador se entrena en función de si logra engañar al discriminador. Normalmente, el generador se inicializa con una entrada aleatoria que se muestrea de un espacio latente predefinido (por ejemplo, una distribución normal multivariada ). Posteriormente, los candidatos sintetizados por el generador son evaluados por el discriminador. Se aplican procedimientos de retropropagación independientes a ambas redes para que el generador produzca mejores muestras, mientras que el discriminador se vuelve más hábil para detectar muestras sintéticas. [ 7 ] Cuando se utiliza para la generación de imágenes, el generador suele ser una red neuronal deconvolucional y el discriminador es una red neuronal convolucional .

Relación con otros métodos estadísticos de aprendizaje automático

Las GAN son modelos generativos implícitos , [ 8 ] lo que significa que no modelan explícitamente la función de verosimilitud ni proporcionan un medio para encontrar la variable latente correspondiente a una muestra dada, a diferencia de alternativas como el modelo generativo basado en flujo .

Principales tipos de modelos generativos profundos que realizan estimación de máxima verosimilitud [ 9 ]

En comparación con las redes neuronales totalmente visibles, como WaveNet y PixelRNN, y los modelos autorregresivos en general, las GAN pueden generar una muestra completa en una sola pasada, en lugar de múltiples pasadas a través de la red.

En comparación con las máquinas de Boltzmann y el ICA lineal , no existe ninguna restricción en el tipo de función que utiliza la red.

Dado que las redes neuronales son aproximadores universales , las GAN son asintóticamente consistentes . A partir de 2026, se ha demostrado que los autoencoders variacionales son aproximadores universales [ 10 ] .

Propiedades matemáticas

Consideraciones teóricas de la medida

Esta sección presenta parte de la teoría matemática que sustenta estos métodos.

En la teoría de la probabilidad moderna basada en la teoría de la medida , un espacio de probabilidad también necesita estar equipado con un álgebra σ . Como resultado, una definición más rigurosa del juego GAN implicaría los siguientes cambios:

Cada espacio de probabilidad(Ω,B,μárbitro){\displaystyle (\Omega ,{\mathcal {B}},\mu _{\text{ref}})}define un juego GAN.

El conjunto de estrategias del generador esPAG(Ω,B){\displaystyle {\mathcal {P}}(\Omega,{\mathcal {B}})}, el conjunto de todas las medidas de probabilidadμGRAMO{\displaystyle \mu _{G}}en el espacio de medidas(Ω,B){\displaystyle (\Omega,{\mathcal {B}})}.

El conjunto de estrategias del discriminador es el conjunto de núcleos de Markov.μD:(Ω,B)PAG([0,1],B([0,1])){\displaystyle \mu _{D}:(\Omega ,{\mathcal {B}})\to {\mathcal {P}}([0,1],{\mathcal {B}}([0,1]))}, dóndeB([0,1]){\displaystyle {\mathcal {B}}([0,1])}es el álgebra σ de Borel en[0,1]{\displaystyle [0,1]}.

Dado que en la práctica nunca surgen problemas de mensurabilidad, no nos ocuparemos más de ellos.

Elección del conjunto de estrategias

En la versión más genérica del juego GAN descrito anteriormente, el conjunto de estrategias para el discriminador contiene todos los núcleos de Markov.μD:ΩPAG[0,1]{\displaystyle \mu _{D}:\Omega \to {\mathcal {P}}[0,1]}y el conjunto de estrategias para el generador contiene distribuciones de probabilidad arbitrariasμGRAMO{\displaystyle \mu _{G}}enΩ{\displaystyle \Omega }.

Sin embargo, como se muestra a continuación, la estrategia discriminadora óptima contra cualquierμGRAMO{\displaystyle \mu _{G}}es determinista, por lo que no hay pérdida de generalidad al restringir las estrategias del discriminador a funciones deterministas.D:Ω[0,1]{\displaystyle D:\Omega \to [0,1]}En la mayoría de las aplicaciones,D{\displaystyle D}es una función de red neuronal profunda .

En cuanto al generador, mientrasμGRAMO{\displaystyle \mu _{G}}En teoría, podría ser cualquier distribución de probabilidad computable; en la práctica, suele implementarse como un pushforward :μGRAMO=μZGRAMO1{\displaystyle \mu _{G}=\mu _{Z}\circ G^{-1}}Es decir, comenzar con una variable aleatoria.zμZ{\displaystyle z\sim \mu _{Z}}, dóndeμZ{\displaystyle \mu _{Z}}es una distribución de probabilidad que es fácil de calcular (como la distribución uniforme o la distribución gaussiana ), luego define una funciónGRAMO:ΩZΩ{\displaystyle G:\Omega _ {Z}\a \Omega }. Luego la distribuciónμGRAMO{\displaystyle \mu _{G}}es la distribución deGRAMO(z){\displaystyle G(z)}.

En consecuencia, la estrategia del generador se define generalmente como simplementeGRAMO{\displaystyle G}, partidazμZ{\displaystyle z\sim \mu _{Z}}implícito. En este formalismo, el objetivo del juego GAN esL(GRAMO,D):=miincógnitaμárbitro[lnD(incógnita)]+mizμZ[ln(1D(GRAMO(z)))].{\displaystyle L(G,D):=\operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln D(x)]+\operatorname {E} _{z\sim \mu _{Z}}[\ln(1-D(G(z)))].}

Reparametrización generativa

La arquitectura GAN tiene dos componentes principales. Uno es convertir la optimización en un juego, de formaminGRAMOmáximoDL(GRAMO,D){\displaystyle \min _{G}\max _{D}L(G,D)}, que es diferente del tipo habitual de optimización, de formaminθL(θ){\displaystyle \min _{\theta }L(\theta )}. La otra es la descomposición deμGRAMO{\displaystyle \mu _{G}}enμZGRAMO1{\displaystyle \mu _ {Z}\circ G^{-1}}, lo cual puede entenderse como un truco de reparametrización.

Para comprender su importancia, es necesario comparar GAN con métodos anteriores para el aprendizaje de modelos generativos, los cuales estaban plagados de "cálculos probabilísticos intratables que surgen en la estimación de máxima verosimilitud y estrategias relacionadas". [ 1 ]

Al mismo tiempo, Kingma y Welling [ 11 ] y Rezende et al. [ 12 ] desarrollaron la misma idea de reparametrización en un método general de retropropagación estocástica. Entre sus primeras aplicaciones se encontraba el autoencoder variacional .

Orden de movimiento y equilibrios estratégicos

En el artículo original, así como en la mayoría de los artículos posteriores, se suele asumir que el generador se mueve primero y el discriminador se mueve segundo , lo que da como resultado el siguiente juego minimax:minμGRAMOmáximoμDL(μGRAMO,μD):=miincógnitaμárbitro,yμD(incógnita)[lny]+miincógnitaμGRAMO,yμD(incógnita)[ln(1y)].{\displaystyle \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D}):=\operatorname {E} _{x\sim \mu _{\text{ref}},y\sim \mu _{D}(x)}[\ln y]+\operatorname {E} _{x\sim \mu _{G},y\sim \mu _{D}(x)}[\ln(1-y)].}

Si tanto el conjunto de estrategias del generador como el del discriminador están abarcados por un número finito de estrategias, entonces por el teorema minimax ,minμGRAMOmáximoμDL(μGRAMO,μD)=máximoμDminμGRAMOL(μGRAMO,μD){\displaystyle \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D})=\max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D})}Es decir, el orden de los movimientos no importa.

Sin embargo, dado que los conjuntos de estrategias no son finitamente generados, el teorema minimax no se aplica y la idea de "equilibrio" se vuelve delicada. A saber, existen los siguientes conceptos diferentes de equilibrio:

  • Equilibrio cuando el generador se mueve primero y el discriminador se mueve después:μ^GRAMOargminμGRAMOmáximoμDL(μGRAMO,μD),μ^DargmáximoμDL(μ^GRAMO,μD),{\displaystyle {\hat {\mu }}_{G}\in \arg \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D}),\quad {\hat {\mu }}_{D}\in \arg \max _{\mu _{D}}L({\hat {\mu }}_{G},\mu _{D}),\quad }
  • Equilibrio cuando el discriminador se mueve primero y el generador se mueve después:μ^DargmáximoμDminμGRAMOL(μGRAMO,μD),μ^GRAMOargminμGRAMOL(μGRAMO,μ^D),{\displaystyle {\hat {\mu }}_{D}\in \arg \max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D}),\quad {\hat {\mu }}_{G}\in \arg \min _{\mu _{G}}L(\mu _{G},{\hat {\mu }}_{D}),}
  • equilibrio de Nash(μ^D,μ^GRAMO){\displaystyle ({\hat {\mu }}_{D},{\hat {\mu }}_{G})}, que es estable bajo un orden de movimiento simultáneo:μ^DargmáximoμDL(μ^GRAMO,μD),μ^GRAMOargminμGRAMOL(μGRAMO,μ^D){\displaystyle {\hat {\mu }}_{D}\in \arg \max _{\mu _{D}}L({\hat {\mu }}_{G},\mu _{D}),\quad {\hat {\mu }}_{G}\in \arg \min _{\mu _{G}}L(\mu _{G},{\hat {\mu }}_{D})}

Para juegos generales, estos equilibrios no tienen por qué coincidir, ni siquiera existir. Para el juego GAN original, todos estos equilibrios existen y son todos iguales. Sin embargo, para juegos GAN más generales, no necesariamente existen ni coinciden. [ 13 ]

Teoremas principales para juegos GAN

El artículo original de GAN demostró los siguientes dos teoremas: [ 1 ]

Teorema (el discriminador óptimo calcula la divergencia de Jensen-Shannon) Para cualquier estrategia de generador fijo μGRAMO{\displaystyle \mu _{G}}, sea la respuesta óptimaD=argmáximoDL(μGRAMO,D){\displaystyle D^{*}=\arg \max _{D}L(\mu _{G},D)}, entonces

D(incógnita)=dμárbitrod(μárbitro+μGRAMO)L(μGRAMO,D)=2DJS(μárbitro;μGRAMO)2ln2{\displaystyle {\begin{aligned}D^{*}(x)&={\frac {d\mu _{\text{ref}}}{d(\mu _{\text{ref}}+\mu _{G})}}\\[6pt]L(\mu _{G},D^{*})&=2D_{JS}(\mu _{\text{ref}};\mu _{G})-2\ln 2\end{aligned}}}

donde la derivada es la derivada de Radon-Nikodym , yDJS{\displaystyle D_{JS}}es la divergencia de Jensen-Shannon .

Prueba

Por la desigualdad de Jensen,

miincógnitaμárbitro,yμD(incógnita)[lny]miincógnitaμárbitro[lnmiyμD(incógnita)[y]]{\displaystyle \operatorname {E} _{x\sim \mu _{\text{ref}},y\sim \mu _{D}(x)}[\ln y]\leq \operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln \operatorname {E} _{y\sim \mu _{D}(x)}[y]]} y de forma similar para el otro término. Por lo tanto, la respuesta óptima puede ser determinista, es decirμD(incógnita)=δD(incógnita){\displaystyle \mu _{D}(x)=\delta _{D(x)}}para alguna funciónD:Ω[0,1]{\displaystyle D:\Omega \to [0,1]}, en cuyo caso

L(μGRAMO,μD):=miincógnitaμárbitro[lnD(incógnita)]+miincógnitaμGRAMO[ln(1D(incógnita))].{\displaystyle L(\mu _{G},\mu _{D}):=\operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln D(x)]+\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))].}

Para definir funciones de densidad adecuadas, definimos una medida base.μ:=μárbitro+μGRAMO{\displaystyle \mu :=\mu _{\text{ref}}+\mu _{G}} , lo que nos permite tomar las derivadas de Radon–Nikodym

ρárbitro=dμárbitrodμρGRAMO=dμGRAMOdμ{\displaystyle \rho _{\text{ref}}={\frac {d\mu _{\text{ref}}}{d\mu }}\quad \rho _{G}={\frac {d\mu _{G}}{d\mu }}} conρárbitro+ρGRAMO=1{\displaystyle \rho _{\text{ref}}+\rho _{G}=1}.

Entonces tenemos

L(μGRAMO,μD):=μ(dincógnita)[ρárbitro(incógnita)ln(D(incógnita))+ρGRAMO(incógnita)ln(1D(incógnita))].{\displaystyle L(\mu _{G},\mu _{D}):=\int \mu (dx)\left[\rho _{\text{ref}}(x)\ln(D(x))+\rho _{G}(x)\ln(1-D(x))\right].}

El integrando es simplemente la entropía cruzada negativa entre dos variables aleatorias de Bernoulli con parámetrosρárbitro(incógnita){\displaystyle \rho _{\text{ref}}(x)}yD(incógnita){\displaystyle D(x)}Podemos escribir esto comoH(ρárbitro(incógnita))DKL(ρárbitro(incógnita)D(incógnita)){\displaystyle -H(\rho _{\text{ref}}(x))-D_{KL}(\rho _{\text{ref}}(x)\parallel D(x))}, dóndeH{\displaystyle H}es la función de entropía binaria , por lo tanto

L(μGRAMO,μD)=μ(dincógnita)(H(ρárbitro(incógnita))+DKL(ρárbitro(incógnita)D(incógnita))).{\displaystyle L(\mu _{G},\mu _{D})=-\int \mu (dx)(H(\rho _{\text{ref}}(x))+D_{KL}(\rho _{\text{ref}}(x)\parallel D(x))).}

Esto significa que la estrategia óptima para el discriminador esD(incógnita)=ρárbitro(incógnita){\displaystyle D(x)=\rho _{\text{ref}}(x)}, con L(μGRAMO,μD)=μ(dincógnita)H(ρárbitro(incógnita))=DJS(μárbitroμGRAMO)2ln2{\displaystyle L(\mu _{G},\mu _{D}^{*})=-\int \mu (dx)H(\rho _{\text{ref}}(x))=D_{JS}(\mu _{\text{ref}}\parallel \mu _{G})-2\ln 2}

después del cálculo de rutina.

Interpretación : Para cualquier estrategia de generador fijoμGRAMO{\displaystyle \mu _{G}}El discriminador óptimo realiza un seguimiento de la razón de verosimilitud entre la distribución de referencia y la distribución del generador:D(incógnita)1D(incógnita)=dμárbitrodμGRAMO(incógnita)=μárbitro(dincógnita)μGRAMO(dincógnita);D(incógnita)=σ(lnμárbitro(dincógnita)lnμGRAMO(dincógnita)){\displaystyle {\frac {D(x)}{1-D(x)}}={\frac {d\mu _{\text{ref}}}{d\mu _{G}}}(x)={\frac {\mu _{\text{ref}}(dx)}{\mu _{G}(dx)}};\quad D(x)=\sigma (\ln \mu _{\text{ref}}(dx)-\ln \mu _{G}(dx))}dóndeσ{\displaystyle \sigma }es la función logística . En particular, si la probabilidad previa para una imagenincógnita{\displaystyle x}provenir de la distribución de referencia es igual a12{\displaystyle {\frac {1}{2}}}, entoncesD(incógnita){\displaystyle D(x)}es simplemente la probabilidad posterior de queincógnita{\displaystyle x}Provenía de la distribución de referencia:D(incógnita)=Pr(incógnita Proviene de la distribución de referenciaincógnita).{\displaystyle D(x)=\Pr(x{\text{ came from reference distribution}}\mid x).}

Teorema (el punto de equilibrio único) Para cualquier juego GAN, existe un par (μ^D,μ^GRAMO){\displaystyle ({\hat {\mu }}_{D},{\hat {\mu }}_{G})}Eso es a la vez un equilibrio secuencial y un equilibrio de Nash:

L(μ^GRAMO,μ^D)=minμGRAMOmáximoμDL(μGRAMO,μD)=máximoμDminμGRAMOL(μGRAMO,μD)=2ln2μ^DargmáximoμDminμGRAMOL(μGRAMO,μD),μ^GRAMOargminμGRAMOmáximoμDL(μGRAMO,μD)μ^DargmáximoμDL(μ^GRAMO,μD),μ^GRAMOargminμGRAMOL(μGRAMO,μ^D)incógnitaΩ,μ^D(incógnita)=δ12,μ^GRAMO=μárbitro{\displaystyle {\begin{aligned}&L({\hat {\mu }}_{G},{\hat {\mu }}_{D})=\min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D})=&\max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D})=-2\ln 2\\[6pt]&{\hat {\mu }}_{D}\in \arg \max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D}),&\quad {\hat {\mu }}_{G}\in \arg \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D})\\[6pt]&{\hat {\mu }}_{D}\in \arg \max _{\mu _{D}}L({\hat {\mu }}_{G},\mu _{D}),&\quad {\hat {\mu }}_{G}\in \arg \min _{\mu _{G}}L(\mu _{G},{\hat {\mu }}_{D})\\[6pt]&\forall x\in \Omega ,{\hat {\mu }}_{D}(x)=\delta _{\frac {1}{2}},&\quad {\hat {\mu }}_{G}=\mu _{\text{ref}}\end{aligned}}}

Es decir, el generador imita perfectamente la referencia y el discriminador emite12{\displaystyle {\frac {1}{2}}}de forma determinista en todas las entradas.

Prueba

De la proposición anterior,

argminμGRAMOmáximoμDL(μGRAMO,μD)=μárbitro;minμGRAMOmáximoμDL(μGRAMO,μD)=2ln2.{\displaystyle \arg \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D})=\mu _{\text{ref}};\quad \min _{\mu _{G}}\max _{\mu _{D}}L(\mu _{G},\mu _{D})=-2\ln 2.}

Para cualquier estrategia de discriminador fijoμD{\displaystyle \mu _{D}}, cualquierμGRAMO{\displaystyle \mu _{G}}concentrado en el set

{incógnitamiyμD(incógnita)[ln(1y)]=infincógnitamiyμD(incógnita)[ln(1y)]}{\displaystyle \{x\mid \operatorname {E} _{y\sim \mu _{D}(x)}[\ln(1-y)]=\inf _{x}\operatorname {E} _{y\sim \mu _{D}(x)}[\ln(1-y)]\}} es una estrategia óptima para el generador. Por lo tanto,

argmáximoμDminμGRAMOL(μGRAMO,μD)=argmáximoμDmiincógnitaμárbitro,yμD(incógnita)[lny]+infincógnitamiyμD(incógnita)[ln(1y)].{\displaystyle \arg \max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D})=\arg \max _{\mu _{D}}\operatorname {E} _{x\sim \mu _{\text{ref}},y\sim \mu _{D}(x)}[\ln y]+\inf _{x}\operatorname {E} _{y\sim \mu _{D}(x)}[\ln(1-y)].}

Según la desigualdad de Jensen, el discriminador solo puede mejorar adoptando la estrategia determinista de jugar siempreD(incógnita)=miyμD(incógnita)[y]{\displaystyle D(x)=\operatorname {E} _{y\sim \mu _{D}(x)}[y]}. Por lo tanto,

argmáximoμDminμGRAMOL(μGRAMO,μD)=argmáximoDmiincógnitaμárbitro[lnD(incógnita)]+infincógnitaln(1D(incógnita)){\displaystyle \arg \max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D})=\arg \max _{D}\operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln D(x)]+\inf _{x}\ln(1-D(x))}

Por la desigualdad de Jensen,

lnmiincógnitaμárbitro[D(incógnita)]+infincógnitaln(1D(incógnita))=lnmiincógnitaμárbitro[D(incógnita)]+ln(1sorberincógnitaD(incógnita))=ln[miincógnitaμárbitro[D(incógnita)](1sorberincógnitaD(incógnita))]ln[sorberincógnitaD(incógnita))(1sorberincógnitaD(incógnita))]ln14,{\displaystyle {\begin{aligned}&\ln \operatorname {E} _{x\sim \mu _{\text{ref}}}[D(x)]+\inf _{x}\ln(1-D(x))\\[6pt]={}&\ln \operatorname {E} _{x\sim \mu _{\text{ref}}}[D(x)]+\ln(1-\sup _{x}D(x))\\[6pt]={}&\ln[\operatorname {E} _{x\sim \mu _{\text{ref}}}[D(x)](1-\sup _{x}D(x))]\leq \ln[\sup _{x}D(x))(1-\sup _{x}D(x))]\leq \ln {\frac {1}{4}},\end{aligned}}}

con igualdad siD(incógnita)=12{\displaystyle D(x)={\frac {1}{2}}}, entonces

incógnitaΩ,μ^D(incógnita)=δ12;máximoμDminμGRAMOL(μGRAMO,μD)=2ln2.{\displaystyle \forall x\in \Omega ,{\hat {\mu }}_{D}(x)=\delta _{\frac {1}{2}};\quad \max _{\mu _{D}}\min _{\mu _{G}}L(\mu _{G},\mu _{D})=-2\ln 2.}

Finalmente, para comprobar que se trata de un equilibrio de Nash, observe que cuandoμGRAMO=μárbitro{\displaystyle \mu _{G}=\mu _{\text{ref}}}, tenemos

L(μGRAMO,μD):=miincógnitaμárbitro,yμD(incógnita)[ln(y(1y))]{\displaystyle L(\mu _{G},\mu _{D}):=\operatorname {E} _{x\sim \mu _{\text{ref}},y\sim \mu _{D}(x)}[\ln(y(1-y))]} que siempre se maximiza pory=12{\displaystyle y={\frac {1}{2}}}.

CuandoincógnitaΩ,μD(incógnita)=δ12{\displaystyle \forall x\in \Omega ,\mu _{D}(x)=\delta _{\frac {1}{2}}}Cualquier estrategia es óptima para el generador.

Entrenamiento y evaluación de GAN

Capacitación

Convergencia inestable

Si bien el juego GAN tiene un punto de equilibrio global único cuando tanto el generador como el discriminador tienen acceso a todos sus conjuntos de estrategias, el equilibrio ya no está garantizado cuando tienen un conjunto de estrategias restringido. [ 13 ]

En la práctica, el generador solo tiene acceso a medidas de formaμZGRAMOθ1{\displaystyle \mu _{Z}\circ G_{\theta }^{-1}}, dóndeGRAMOθ{\displaystyle G_{\theta }}es una función calculada por una red neuronal con parámetrosθ{\displaystyle \theta }, yμZ{\displaystyle \mu _{Z}}es una distribución fácilmente muestreable, como la distribución uniforme o la distribución normal. De manera similar, el discriminador solo tiene acceso a funciones de formaDζ{\displaystyle D_{\zeta }}, una función calculada por una red neuronal con parámetrosζ{\displaystyle \zeta }Estos conjuntos de estrategias restringidas ocupan una proporción ínfima de sus conjuntos de estrategias totales. [ 14 ]

Además, incluso si aún existe un equilibrio, este solo puede encontrarse mediante la búsqueda en el espacio de alta dimensión de todas las posibles funciones de la red neuronal. La estrategia estándar de usar el descenso de gradiente para encontrar el equilibrio a menudo no funciona para las GAN, y con frecuencia el juego "colapsa" en uno de varios modos de fallo. Para mejorar la estabilidad de la convergencia, algunas estrategias de entrenamiento comienzan con una tarea más sencilla, como generar imágenes de baja resolución [ 15 ] o imágenes simples (un objeto con fondo uniforme) [ 16 ] , y aumentan gradualmente la dificultad de la tarea durante el entrenamiento. Esto se traduce esencialmente en la aplicación de un esquema de aprendizaje curricular [ 17 ] .

Colapso de modo

Las GAN suelen sufrir colapso modal, donde no logran generalizar correctamente, omitiendo modos completos de los datos de entrada. Por ejemplo, una GAN entrenada con el conjunto de datos MNIST , que contiene muchas muestras de cada dígito, podría generar únicamente imágenes del dígito 0. Esto se denominó "el escenario Helvetica". [ 1 ]

Un mecanismo típico de colapso modal es que el generador solo produzca uno o pocos de los valores probables, o una imagen muy incompleta de la distribución objetivo. Dado que el discriminador solo está entrenado para distinguir muestras reales de falsas, identificará correctamente las muestras generadas como reales, pero no se impone ninguna penalización a la capacidad de la GAN para generar datos que representen el rango completo de la distribución objetivo.

Los discriminadores débiles, por ejemplo, los que están insuficientemente parametrizados o los que se entrenan demasiado lento en comparación con el generador, pueden ser incapaces de discriminar completamente en todo el rango de la distribución y solo ser capaces de discriminar correctamente una parte muy incompleta de la distribución objetivo.

Algunos investigadores consideran que el problema fundamental reside en una red discriminativa débil que no logra detectar el patrón de omisión, mientras que otros atribuyen la culpa a una mala elección de la función objetivo . Se han propuesto numerosas soluciones, pero sigue siendo un problema abierto. [ 18 ] [ 19 ]

Incluso la arquitectura de vanguardia, BigGAN (2019), no pudo evitar el colapso modal. Los autores recurrieron a "permitir que el colapso ocurriera en las etapas posteriores del entrenamiento, momento en el que un modelo está suficientemente entrenado para lograr buenos resultados". [ 20 ]

Regla de actualización de dos escalas de tiempo

La regla de actualización de dos escalas de tiempo (TTUR) se propone para lograr una convergencia más estable de las GAN al reducir la tasa de aprendizaje del generador con respecto a la del discriminador. Demuestran que, al entrenarse de esta manera, las GAN "convergen, bajo supuestos leves, a un equilibrio de Nash local estacionario". [ 21 ] Además, muestran que esta propiedad se extiende al uso del optimizador Adam, comúnmente utilizado en el descenso de gradiente estocástico.

Un equilibrio de Nash local no significa en absoluto la ausencia de colapso modal; por ejemplo, una GAN entrenada en MNIST que colapsa para generar un solo dígito puede satisfacer las hipótesis del artículo, al tiempo que presenta colapso modal.

Gradiente evanescente

Por el contrario, si el discriminador aprende demasiado rápido en comparación con el generador, entonces el discriminador podría distinguir casi perfectamenteμGRAMOθ,μárbitro{\displaystyle \mu _{G_{\theta }},\mu _{\text{ref}}}En tal caso, el generadorGRAMOθ{\displaystyle G_{\theta }}podría quedar atrapado con una pérdida muy alta sin importar en qué dirección cambie suθ{\displaystyle \theta }, lo que significa que el gradienteθL(GRAMOθ,Dζ){\displaystyle \nabla _{\theta }L(G_{\theta },D_{\zeta })}sería cercano a cero. En tal caso, el generador no puede aprender, un caso del problema del gradiente evanescente . [ 14 ]

Intuitivamente hablando, el discriminador es demasiado bueno, y como el generador no puede dar ningún pequeño paso (solo se consideran pasos pequeños en el descenso de gradiente) para mejorar su resultado, ni siquiera lo intenta.

Un método importante para resolver este problema es la GAN de Wasserstein .

Evaluación

Las GAN se suelen evaluar mediante la puntuación Inception (IS), que mide la variabilidad de las salidas del generador (clasificadas por un clasificador de imágenes, normalmente Inception-v3 ), o la distancia Fréchet Inception (FID), que mide la similitud de las salidas del generador con un conjunto de referencia (clasificadas por un extractor de características de imagen aprendido, como Inception-v3 sin su capa final). Muchos artículos que proponen nuevas arquitecturas GAN para la generación de imágenes informan de cómo sus arquitecturas superan el estado del arte en FID o IS.

Otro método de evaluación es la similitud de parches de imagen perceptual aprendida (LPIPS), que comienza con un analizador de características de imagen aprendido.Fθ:ImagenRnorte{\displaystyle f_{\theta }:{\text{Image}}\to \mathbb {R} ^{n}}y lo ajusta mediante aprendizaje supervisado en un conjunto de(incógnita,incógnita,pagmirdomipagtal diFFmirminortedomi(incógnita,incógnita)){\displaystyle (x,x',\operatorname {perceptual~difference} (x,x'))}, dóndeincógnita{\displaystyle x}es una imagen,incógnita{\displaystyle x'}es una versión perturbada de ella, ypagmirdomipagtal diFFmirminortedomi(incógnita,incógnita){\displaystyle \operatorname {perceptual~difference} (x,x')}es cuánto difieren, según lo informado por sujetos humanos. El modelo está ajustado para que pueda aproximarseFθ(incógnita)Fθ(incógnita)pagmirdomipagtal diFFmirminortedomi(incógnita,incógnita){\displaystyle \|f_{\theta }(x)-f_{\theta }(x')\|\approx \operatorname {perceptual~difference} (x,x')}Este modelo ajustado se utiliza luego para definirLPIPS(incógnita,incógnita):=Fθ(incógnita)Fθ(incógnita){\displaystyle \operatorname {LPIPS} (x,x'):=\|f_{\theta }(x)-f_{\theta }(x')\|}. [ 22 ]

Otros métodos de evaluación se revisan en [ 23 ] .

Variantes

Existe un auténtico zoológico de variantes de GAN. [ 24 ] Algunas de las más destacadas son las siguientes:

GAN condicional

Las GAN condicionales son similares a las GAN estándar, con la diferencia de que permiten que el modelo genere muestras de forma condicional basándose en información adicional. Por ejemplo, si queremos generar la cara de un gato a partir de la imagen de un perro, podríamos usar una GAN condicional.

El generador en un juego GAN generaμGRAMO{\displaystyle \mu _{G}}, una distribución de probabilidad en el espacio de probabilidadΩ{\displaystyle \Omega }. Esto lleva a la idea de una GAN condicional, donde en lugar de generar una distribución de probabilidad enΩ{\displaystyle \Omega }El generador genera una distribución de probabilidad diferente.μGRAMO(do){\displaystyle \mu _{G}(c)}enΩ{\displaystyle \Omega }, para cada etiqueta de clase dadado{\displaystyle c}.

Por ejemplo, para generar imágenes que se parezcan a ImageNet , el generador debería poder generar una imagen de un gato cuando se le proporcione la etiqueta de clase "cat".

En el artículo original, [ 1 ] los autores señalaron que GAN puede extenderse trivialmente a GAN condicional proporcionando las etiquetas tanto al generador como al discriminador.

Concretamente, el juego GAN condicional es simplemente el juego GAN con etiquetas de clase proporcionadas:L(μGRAMO,D):=midoμdo,incógnitaμárbitro(do)[lnD(incógnita,do)]+midoμdo,incógnitaμGRAMO(do)[ln(1D(incógnita,do))]{\displaystyle L(\mu _{G},D):=\operatorname {E} _{c\sim \mu _{C},x\sim \mu _{\text{ref}}(c)}[\ln D(x,c)]+\operatorname {E} _{c\sim \mu _{C},x\sim \mu _{G}(c)}[\ln(1-D(x,c))]}dóndeμdo{\displaystyle \mu _{C}}es una distribución de probabilidad sobre clases,μárbitro(do){\displaystyle \mu _{\text{ref}}(c)}es la distribución de probabilidad de imágenes reales de clasedo{\displaystyle c}, yμGRAMO(do){\displaystyle \mu _{G}(c)}la distribución de probabilidad de las imágenes generadas por el generador cuando se le da una etiqueta de clasedo{\displaystyle c}.

En 2017, una GAN condicional aprendió a generar 1000 clases de imágenes de ImageNet . [ 25 ]

GANs con arquitecturas alternativas

El juego GAN es un marco general y puede ejecutarse con cualquier parametrización razonable del generador.GRAMO{\displaystyle G}y discriminadorD{\displaystyle D}En el artículo original, los autores lo demostraron utilizando redes perceptrón multicapa y redes neuronales convolucionales . Se han probado muchas arquitecturas alternativas.

GAN convolucional profunda (DCGAN): [ 26 ] Tanto para el generador como para el discriminador, utiliza únicamente redes profundas que consisten enteramente en capas de convolución-deconvolución, es decir, redes totalmente convolucionales. [ 27 ]

GAN de autoatención (SAGAN): [ 28 ] Comienza con la DCGAN, luego agrega módulos de autoatención estándar conectados residualmente al generador y al discriminador.

GAN autoencoder variacional (VAEGAN): [ 29 ] Utiliza un autoencoder variacional (VAE) para el generador.

Transformer GAN (TransGAN): [ 30 ] Utiliza la arquitectura de transformador puro tanto para el generador como para el discriminador, completamente desprovista de capas de convolución-deconvolución.

Flow-GAN: [ 31 ] Utiliza un modelo generativo basado en flujo para el generador, lo que permite un cálculo eficiente de la función de verosimilitud.

GANs con objetivos alternativos

Muchas variantes de GAN se obtienen simplemente cambiando las funciones de pérdida del generador y del discriminador.

GAN original:

Reformulamos el objetivo original de GAN en un formato más conveniente para la comparación:{minDLD(D,μGRAMO)=miincógnitaμGRAMO[lnD(incógnita)]miincógnitaμárbitro[ln(1D(incógnita))]minGRAMOLGRAMO(D,μGRAMO)=miincógnitaμGRAMO[ln(1D(incógnita))]{\displaystyle {\begin{cases}\min _{D}L_{D}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{G}}[\ln D(x)]-\operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln(1-D(x))]\\\min _{G}L_{G}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))]\end{cases}}}

GAN original, pérdida no saturante:

Este objetivo para el generador fue recomendado en el artículo original para una convergencia más rápida. [ 1 ]LGRAMO=miincógnitaμGRAMO[lnD(incógnita)]{\displaystyle L_{G}=\operatorname {E} _{x\sim \mu _{G}}[\ln D(x)]}El efecto de utilizar este objetivo se analiza en la Sección 2.2.2 de Arjovsky et al. [ 32 ].

GAN original, máxima verosimilitud:

LGRAMO=miincógnitaμGRAMO[(expσ1D)(incógnita)]{\displaystyle L_{G}=\operatorname {E} _{x\sim \mu _{G}}[({\exp }\circ \sigma ^{-1}\circ D)(x)]}dóndeσ{\displaystyle \sigma }es la función logística. Cuando el discriminador es óptimo, el gradiente del generador es el mismo que en la estimación de máxima verosimilitud , aunque GAN no puede realizar la estimación de máxima verosimilitud por sí mismo . [ 33 ] [ 34 ]

GAN con pérdida de bisagra : [ 35 ]LD=miincógnitapagárbitro[min(0,1+D(incógnita))]miincógnitaμGRAMO[min(0,1D(incógnita))]{\displaystyle L_{D}=-\operatorname {E} _{x\sim p_{\text{ref}}}\left[\min \left(0,-1+D(x)\right)\right]-\operatorname {E} _{x\sim \mu _{G}}\left[\min \left(0,-1-D\left(x\right)\right)\right]}LGRAMO=miincógnitaμGRAMO[D(incógnita)]{\displaystyle L_{G}=-\operatorname {E} _{x\sim \mu _{G}}[D(x)]}GAN de mínimos cuadrados: [ 36 ]LD=miincógnitaμárbitro[(D(incógnita)b)2]+miincógnitaμGRAMO[(D(incógnita)a)2]{\displaystyle L_{D}=\operatorname {E} _{x\sim \mu _{\text{ref}}}[(D(x)-b)^{2}]+\operatorname {E} _{x\sim \mu _{G}}[(D(x)-a)^{2}]}LGRAMO=miincógnitaμGRAMO[(D(incógnita)do)2]{\displaystyle L_{G}=\operatorname {E} _{x\sim \mu _{G}}[(D(x)-c)^{2}]}dóndea,b,do{\displaystyle a,b,c}son parámetros a elegir. Los autores recomiendana=1,b=1,do=0{\displaystyle a=-1,b=1,c=0}.

Red generativa antagónica de Wasserstein (WGAN)

La GAN de Wasserstein modifica el juego GAN en dos puntos:

  • El conjunto de estrategias del discriminador es el conjunto de funciones medibles de tipoD:ΩR{\displaystyle D:\Omega \to \mathbb {R} }con norma de Lipschitz acotada :DLK{\displaystyle \|D\|_{L}\leq K}, dóndeK{\displaystyle K}es una constante positiva fija.
  • El objetivo esLWGRAMOAnorte(μGRAMO,D):=miincógnitaμGRAMO[D(incógnita)]miincógnitaμárbitro[D(incógnita)]{\displaystyle L_{WGAN}(\mu _{G},D):=\operatorname {E} _{x\sim \mu _{G}}[D(x)]-\mathbb {E} _{x\sim \mu _{\text{ref}}}[D(x)]}

Uno de sus propósitos es resolver el problema del colapso de modos (ver arriba). [ 14 ] Los autores afirman: "En ningún experimento vimos evidencia de colapso de modos para el algoritmo WGAN".

GANs con más de dos jugadores

autoencoder adversario

Un autoencoder adversarial (AAE) [ 37 ] es más un autoencoder que una GAN. La idea es comenzar con un autoencoder simple , pero entrenar un discriminador para distinguir los vectores latentes de una distribución de referencia (a menudo la distribución normal).

InfoGAN

En GAN condicional, el generador recibe un vector de ruido.z{\displaystyle z}y una etiquetado{\displaystyle c}y produce una imagenGRAMO(z,do){\displaystyle G(z,c)}El discriminador recibe pares de imagen-etiqueta.(incógnita,do){\displaystyle (x,c)}y calculaD(incógnita,do){\displaystyle D(x,c)}.

Cuando el conjunto de datos de entrenamiento no está etiquetado, la GAN condicional no funciona directamente.

La idea de InfoGAN es decretar que cada vector latente en el espacio latente puede descomponerse como(z,do){\displaystyle (z,c)}: una parte de ruido incompresiblez{\displaystyle z}y una parte de etiqueta informativado{\displaystyle c}y alentar al generador a cumplir con el decreto, animándolo a maximizarI(do,GRAMO(z,do)){\displaystyle I(c,G(z,c))}, la información mutua entredo{\displaystyle c}yGRAMO(z,do){\displaystyle G(z,c)}, sin exigir nada a cambio de información mutuaz{\displaystyle z}entreGRAMO(z,do){\displaystyle G(z,c)}.

Desafortunadamente,I(do,GRAMO(z,do)){\displaystyle I(c,G(z,c))}es intratable en general. La idea clave de InfoGAN es la maximización de la información mutua variacional: [ 38 ] la maximiza indirectamente maximizando un límite inferior.I^(GRAMO,Q)=mizμZ,doμdo[lnQ(doGRAMO(z,do))];I(do,GRAMO(z,do))sorberQI^(GRAMO,Q){\displaystyle {\hat {I}}(G,Q)=\mathbb {E} _{z\sim \mu _{Z},c\sim \mu _{C}}[\ln Q(c\mid G(z,c))];\quad I(c,G(z,c))\geq \sup _{Q}{\hat {I}}(G,Q)}dóndeQ{\displaystyle Q}abarca todos los núcleos de Markov de tipoQ:ΩYPAG(Ωdo){\displaystyle Q:\Omega _{Y}\to {\mathcal {P}}(\Omega _{C})}.

El juego InfoGAN se define de la siguiente manera: [ 39 ]

Un juego InfoGAN se define mediante tres espacios de probabilidad:

  • (Ωincógnita,μárbitro){\displaystyle (\Omega _{X},\mu _{\text{ref}})}, el espacio de imágenes de referencia.
  • (ΩZ,μZ){\displaystyle (\Omega _{Z},\mu _{Z})}, el generador de ruido aleatorio fijo.
  • (Ωdo,μdo){\displaystyle (\Omega _{C},\mu _{C})}, el generador de información aleatoria fijo.

Hay 3 jugadores en 2 equipos: generador, Q y discriminador. El generador y Q están en un equipo, y el discriminador en el otro.

La función objetivo esL(GRAMO,Q,D)=LGRAMOAnorte(GRAMO,D)λI^(GRAMO,Q){\displaystyle L(G,Q,D)=L_{GAN}(G,D)-\lambda {\hat {I}}(G,Q)}dóndeLGRAMOAnorte(GRAMO,D)=miincógnitaμárbitro,[lnD(incógnita)]+mizμZ[ln(1D(GRAMO(z,do)))]{\displaystyle L_{GAN}(G,D)=\operatorname {E} _{x\sim \mu _{\text{ref}},}[\ln D(x)]+\operatorname {E} _{z\sim \mu _{Z}}[\ln(1-D(G(z,c)))]}es el objetivo del juego GAN original, yI^(GRAMO,Q)=mizμZ,doμdo[lnQ(doGRAMO(z,do))]{\displaystyle {\hat {I}}(G,Q)=\mathbb {E} _{z\sim \mu _{Z},c\sim \mu _{C}}[\ln Q(c\mid G(z,c))]}

El equipo Generator-Q tiene como objetivo minimizar el objetivo, y el discriminador tiene como objetivo maximizarlo:minGRAMO,QmáximoDL(GRAMO,Q,D){\displaystyle \min _{G,Q}\max _{D}L(G,Q,D)}

GAN bidireccional (BiGAN)

El generador GAN estándar es una función de tipoGRAMO:ΩZΩincógnita{\displaystyle G:\Omega _{Z}\to \Omega _{X}}, es decir, es un mapeo desde un espacio latenteΩZ{\displaystyle \Omega _{Z}}al espacio de la imagenΩincógnita{\displaystyle \Omega _{X}}Esto puede entenderse como un proceso de "decodificación", mediante el cual cada vector latentezΩZ{\displaystyle z\in \Omega _{Z}}es un código para una imagenincógnitaΩincógnita{\displaystyle x\in \Omega _{X}}y el generador realiza la decodificación. Esto lleva naturalmente a la idea de entrenar otra red que realice la "codificación", creando un autoencoder a partir del par codificador-generador.

Ya en el artículo original, [ 1 ] los autores señalaron que "La inferencia aproximada aprendida se puede realizar entrenando una red auxiliar para predecirz{\displaystyle z}dadoincógnita{\displaystyle x}"La arquitectura GAN bidireccional realiza precisamente esto. [ 40 ]

La BiGAN se define de la siguiente manera:

Un juego BiGAN se define mediante dos espacios de probabilidad:

  • (Ωincógnita,μincógnita){\displaystyle (\Omega _{X},\mu _{X})}, el espacio de imágenes de referencia.
  • (ΩZ,μZ){\displaystyle (\Omega _{Z},\mu _{Z})}, el espacio latente.

Hay 3 jugadores divididos en 2 equipos: generador, codificador y discriminador. El generador y el codificador están en un equipo, y el discriminador en el otro.

Las estrategias del generador son funcionesGRAMO:ΩZΩincógnita{\displaystyle G:\Omega _{Z}\to \Omega _{X}}y las estrategias del codificador son funcionesmi:ΩincógnitaΩZ{\displaystyle E:\Omega _{X}\to \Omega _{Z}}Las estrategias del discriminador son funcionesD:Ωincógnita[0,1]{\displaystyle D:\Omega _{X}\to [0,1]}.

La función objetivo esL(GRAMO,mi,D)=miincógnitaμincógnita[lnD(incógnita,mi(incógnita))]+mizμZ[ln(1D(GRAMO(z),z))]{\displaystyle L(G,E,D)=\mathbb {E} _{x\sim \mu _{X}}[\ln D(x,E(x))]+\mathbb {E} _{z\sim \mu _{Z}}[\ln(1-D(G(z),z))]}

El equipo generador-codificador tiene como objetivo minimizar la función objetivo, y el discriminador tiene como objetivo maximizarla:minGRAMO,mimáximoDL(GRAMO,mi,D){\displaystyle \min _{G,E}\max _{D}L(G,E,D)}

En el artículo, dieron una definición más abstracta del objetivo como:L(GRAMO,mi,D)=mi(incógnita,z)μmi,incógnita[lnD(incógnita,z)]+mi(incógnita,z)μGRAMO,Z[ln(1D(incógnita,z))]{\displaystyle L(G,E,D)=\mathbb {E} _{(x,z)\sim \mu _{E,X}}[\ln D(x,z)]+\mathbb {E} _{(x,z)\sim \mu _{G,Z}}[\ln(1-D(x,z))]}dóndeμmi,incógnita(dincógnita,dz)=μincógnita(dincógnita)δmi(incógnita)(dz){\displaystyle \mu _{E,X}(dx,dz)=\mu _{X}(dx)\cdot \delta _{E(x)}(dz)}es la distribución de probabilidad enΩincógnita×ΩZ{\displaystyle \Omega _{X}\times \Omega _{Z}}obtenido al empujarμincógnita{\displaystyle \mu _{X}}avanzar porincógnita(incógnita,mi(incógnita)){\displaystyle x\mapsto (x,E(x))}, yμGRAMO,Z(dincógnita,dz)=δGRAMO(z)(dincógnita)μZ(dz){\displaystyle \mu _{G,Z}(dx,dz)=\delta _{G(z)}(dx)\cdot \mu _{Z}(dz)}es la distribución de probabilidad enΩincógnita×ΩZ{\displaystyle \Omega _{X}\times \Omega _{Z}}obtenido al empujarμZ{\displaystyle \mu _{Z}}avanzar porz(GRAMO(incógnita),z){\displaystyle z\mapsto (G(x),z)}.

Las aplicaciones de los modelos bidireccionales incluyen el aprendizaje semisupervisado , [ 41 ] el aprendizaje automático interpretable , [ 42 ] y la traducción automática neuronal . [ 43 ]

CycleGAN

CycleGAN es una arquitectura para realizar traducciones entre dos dominios, como por ejemplo entre fotos de caballos y fotos de cebras, o fotos de ciudades nocturnas y fotos de ciudades diurnas.

El juego CycleGAN se define de la siguiente manera: [ 44 ]

Hay dos espacios de probabilidad(Ωincógnita,μincógnita),(ΩY,μY){\displaystyle (\Omega _{X},\mu _{X}),(\Omega _{Y},\mu _{Y})}, correspondientes a los dos dominios necesarios para las traducciones de ida y vuelta.

Hay 4 jugadores en 2 equipos: generadoresGRAMOincógnita:ΩincógnitaΩY,GRAMOY:ΩYΩincógnita{\displaystyle G_{X}:\Omega _{X}\to \Omega _{Y},G_{Y}:\Omega _{Y}\to \Omega _{X}}y discriminadoresDincógnita:Ωincógnita[0,1],DY:ΩY[0,1]{\displaystyle D_{X}:\Omega _{X}\to [0,1],D_{Y}:\Omega _{Y}\to [0,1]}.

La función objetivo esL(GRAMOincógnita,GRAMOY,Dincógnita,DY)=LGRAMOAnorte(GRAMOincógnita,Dincógnita)+LGRAMOAnorte(GRAMOY,DY)+λLdoydolmi(GRAMOincógnita,GRAMOY){\displaystyle L(G_{X},G_{Y},D_{X},D_{Y})=L_{GAN}(G_{X},D_{X})+L_{GAN}(G_{Y},D_{Y})+\lambda L_{cycle}(G_{X},G_{Y})}

dóndeλ{\displaystyle \lambda }es un parámetro ajustable positivo,LGRAMOAnorte{\displaystyle L_{GAN}}es el objetivo del juego GAN, yLdoydolmi{\displaystyle L_{cycle}}es la pérdida de consistencia del ciclo :Ldoydolmi(GRAMOincógnita,GRAMOY)=miincógnitaμincógnitaGRAMOincógnita(GRAMOY(incógnita))incógnita+miyμYGRAMOY(GRAMOincógnita(y))y{\displaystyle L_{cycle}(G_{X},G_{Y})=E_{x\sim \mu _{X}}\|G_{X}(G_{Y}(x))-x\|+E_{y\sim \mu _{Y}}\|G_{Y}(G_{X}(y))-y\|}Los generadores buscan minimizar la función objetivo, y los discriminadores buscan maximizarla:minGRAMOincógnita,GRAMOYmáximoDincógnita,DYL(GRAMOincógnita,GRAMOY,Dincógnita,DY){\displaystyle \min _{G_{X},G_{Y}}\max _{D_{X},D_{Y}}L(G_{X},G_{Y},D_{X},D_{Y})}

A diferencia de trabajos anteriores como pix2pix, [ 45 ] que requieren datos de entrenamiento emparejados, cycleGAN no requiere datos emparejados. Por ejemplo, para entrenar un modelo pix2pix para convertir una foto de un paisaje veraniego en una foto de un paisaje invernal y viceversa, el conjunto de datos debe contener pares del mismo lugar en verano e invierno, tomadas desde el mismo ángulo; cycleGAN solo necesitaría un conjunto de fotos de paisajes veraniegos y un conjunto de fotos de paisajes invernales no relacionadas.

GANs con escalas particularmente grandes o pequeñas

BigGAN

BigGAN es esencialmente una GAN de autoatención entrenada a gran escala (hasta 80 millones de parámetros) para generar imágenes grandes de ImageNet (hasta una resolución de 512 x 512), con numerosos trucos de ingeniería para lograr su convergencia. [ 20 ] [ 46 ]

Aumento de datos invertible

Cuando no hay suficientes datos de entrenamiento, la distribución de referenciaμárbitro{\displaystyle \mu _{\text{ref}}}La distribución empírica proporcionada por el conjunto de datos de entrenamiento no puede aproximarse adecuadamente . En estos casos, se puede aplicar el aumento de datos para entrenar la GAN con conjuntos de datos más pequeños. Sin embargo, el aumento de datos ingenuo presenta sus propios problemas.

Consideremos el juego GAN original, ligeramente reformulado de la siguiente manera:{minDLD(D,μGRAMO)=miincógnitaμárbitro[lnD(incógnita)]miincógnitaμGRAMO[ln(1D(incógnita))]minGRAMOLGRAMO(D,μGRAMO)=miincógnitaμGRAMO[ln(1D(incógnita))]{\displaystyle {\begin{cases}\min _{D}L_{D}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{\text{ref}}}[\ln D(x)]-\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))]\\\min _{G}L_{G}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))]\end{cases}}}Ahora utilizamos el aumento de datos mediante el muestreo aleatorio de transformaciones que preservan la semántica.T:ΩΩ{\displaystyle T:\Omega \to \Omega }y aplicándolas al conjunto de datos, para obtener el juego GAN reformulado:{minDLD(D,μGRAMO)=miincógnitaμárbitro,Tμtrans[lnD(T(incógnita))]miincógnitaμGRAMO[ln(1D(incógnita))]minGRAMOLGRAMO(D,μGRAMO)=miincógnitaμGRAMO[ln(1D(incógnita))]{\displaystyle {\begin{cases}\min _{D}L_{D}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{\text{ref}},T\sim \mu _{\text{trans}}}[\ln D(T(x))]-\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))]\\\min _{G}L_{G}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{G}}[\ln(1-D(x))]\end{cases}}}Esto es equivalente a un juego GAN con una distribución diferente.μárbitro{\displaystyle \mu _{\text{ref}}'}, muestreado porT(incógnita){\displaystyle T(x)}, conincógnitaμárbitro,Tμtrans{\displaystyle x\sim \mu _{\text{ref}},T\sim \mu _{\text{trans}}}. Por ejemplo, siμárbitro{\displaystyle \mu _{\text{ref}}}es la distribución de imágenes en ImageNet, yμtrans{\displaystyle \mu _{\text{trans}}}Las muestras se transforman mediante la transformación identidad con una probabilidad de 0,5 y mediante la reflexión horizontal con una probabilidad de 0,5, luegoμárbitro{\displaystyle \mu _{\text{ref}}'}es la distribución de imágenes en ImageNet y ImageNet reflejada horizontalmente, combinadas.

El resultado de dicho entrenamiento sería un generador que imitaμárbitro{\displaystyle \mu _{\text{ref}}'}Por ejemplo, generaría imágenes que parecen recortadas aleatoriamente, si el aumento de datos utiliza recorte aleatorio.

La solución consiste en aplicar técnicas de aumento de datos tanto a las imágenes generadas como a las reales:{minDLD(D,μGRAMO)=miincógnitaμárbitro,Tμtrans[lnD(T(incógnita))]miincógnitaμGRAMO,Tμtrans[ln(1D(T(incógnita)))]minGRAMOLGRAMO(D,μGRAMO)=miincógnitaμGRAMO,Tμtrans[ln(1D(T(incógnita)))]{\displaystyle {\begin{cases}\min _{D}L_{D}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{\text{ref}},T\sim \mu _{\text{trans}}}[\ln D(T(x))]-\operatorname {E} _{x\sim \mu _{G},T\sim \mu _{\text{trans}}}[\ln(1-D(T(x)))]\\\min _{G}L_{G}(D,\mu _{G})=-\operatorname {E} _{x\sim \mu _{G},T\sim \mu _{\text{trans}}}[\ln(1-D(T(x)))]\end{cases}}}Los autores demostraron una generación de alta calidad utilizando conjuntos de datos de tan solo 100 imágenes. [ 47 ]

El artículo StyleGAN-2-ADA señala otro punto sobre el aumento de datos: debe ser invertible . [ 48 ] Continuemos con el ejemplo de generar imágenes de ImageNet. Si el aumento de datos es "rotar aleatoriamente la imagen 0, 90, 180, 270 grados con igual probabilidad", entonces no hay forma de que el generador sepa cuál es la orientación verdadera: Consideremos dos generadoresGRAMO,GRAMO{\displaystyle G,G'}, de tal manera que para cualquier latentez{\displaystyle z}, la imagen generadaGRAMO(z){\displaystyle G(z)}es una rotación de 90 grados deGRAMO(z){\displaystyle G'(z)}Ambas tendrían exactamente la misma pérdida esperada, por lo que ninguna es preferible a la otra.

La solución consiste en utilizar únicamente el aumento de datos invertible: en lugar de "rotar la imagen aleatoriamente 0, 90, 180 y 270 grados con igual probabilidad", utilice "rotar la imagen aleatoriamente 90, 180 y 270 grados con una probabilidad de 0,1 y mantener la imagen sin cambios con una probabilidad de 0,7". De esta forma, el generador sigue siendo recompensado por mantener las imágenes orientadas de la misma manera que las imágenes de ImageNet sin aumentar.

En abstracto, el efecto de las transformaciones de muestreo aleatorioT:ΩΩ{\displaystyle T:\Omega \to \Omega }de la distribuciónμtrans{\displaystyle \mu _{\text{trans}}}Se trata de definir un núcleo de Markov.Ktrans:ΩPAG(Ω){\displaystyle K_{\text{trans}}:\Omega \to {\mathcal {P}}(\Omega )}Luego, el juego GAN con datos aumentados empuja al generador para encontrar algunosμ^GRAMOPAG(Ω){\displaystyle {\hat {\mu }}_{G}\in {\mathcal {P}}(\Omega )}, de tal manera queKtransμárbitro=Ktransμ^GRAMO{\displaystyle K_{\text{trans}}*\mu _{\text{ref}}=K_{\text{trans}}*{\hat {\mu }}_{G}}dónde{\displaystyle *}es la convolución del núcleo de Markov . Un método de aumento de datos se define como invertible si su núcleo de MarkovKtrans{\displaystyle K_{\text{trans}}}SatisfaceKtransμ=Ktransμμ=μμ,μPAG(Ω){\displaystyle K_{\text{trans}}*\mu =K_{\text{trans}}*\mu '\implies \mu =\mu '\quad \forall \mu ,\mu '\in {\mathcal {P}}(\Omega )}Inmediatamente, por definición, vemos que la composición de múltiples métodos de aumento de datos invertibles da como resultado otro método invertible. También por definición, si el método de aumento de datos es invertible, entonces usarlo en un juego GAN no cambia la estrategia óptima.μ^GRAMO{\displaystyle {\hat {\mu }}_{G}}para el generador, que todavía estáμárbitro{\displaystyle \mu _{\text{ref}}}.

Existen dos ejemplos prototípicos de núcleos de Markov invertibles:

Caso discreto : Matrices estocásticas invertibles , cuandoΩ{\displaystyle \Omega }es finito.

Por ejemplo, siΩ={,,,}{\displaystyle \Omega =\{\uparrow ,\downarrow ,\leftarrow ,\rightarrow \}}es el conjunto de cuatro imágenes de una flecha, apuntando en 4 direcciones, y el aumento de datos es "rotar aleatoriamente la imagen 90, 180, 270 grados con probabilidadpag{\displaystyle p}y mantener la imagen tal como está con probabilidad(13pag){\displaystyle (1-3p)}", entonces el núcleo de MarkovKtrans{\displaystyle K_{\text{trans}}}puede representarse como una matriz estocástica:[Ktrans]=[(13pag)pagpagpagpag(13pag)pagpagpagpag(13pag)pagpagpagpag(13pag)]{\displaystyle [K_{\text{trans}}]={\begin{bmatrix}(1-3p)&p&p&p\\p&(1-3p)&p&p\\p&p&(1-3p)&p\\p&p&p&(1-3p)\end{bmatrix}}}yKtrans{\displaystyle K_{\text{trans}}}es un núcleo invertible si y solo si[Ktrans]{\displaystyle [K_{\text{trans}}]}es una matriz invertible, es decir,pag1/4{\displaystyle p\neq 1/4}.

Caso continuo : El núcleo gaussiano, cuandoΩ=Rnorte{\displaystyle \Omega =\mathbb {R} ^{n}}para algunosnorte1{\displaystyle n\geq 1}.

Por ejemplo, siΩ=R2562{\displaystyle \Omega =\mathbb {R} ^{256^{2}}}es el espacio de imágenes de 256x256, y el método de aumento de datos es "generar un ruido gaussiano".znorte(0,I2562){\displaystyle z\sim {\mathcal {N}}(0,I_{256^{2}})}, luego añadeϵz{\displaystyle \epsilon z}a la imagen", entoncesKtrans{\displaystyle K_{\text{trans}}}es simplemente una convolución por la función de densidad denorte(0,ϵ2I2562){\displaystyle {\mathcal {N}}(0,\epsilon ^{2}I_{256^{2}})}. Esto es invertible, porque la convolución por una gaussiana es simplemente la convolución por el núcleo de calor , por lo que dado cualquierμPAG(Rnorte){\displaystyle \mu \in {\mathcal {P}}(\mathbb {R} ^{n})}, la distribución convolucionadaKtransμ{\displaystyle K_{\text{trans}}*\mu }se puede obtener calentandoRnorte{\displaystyle \mathbb {R} ^{n}}precisamente segúnμ{\displaystyle \mu }, luego espera el tiempoϵ2/4{\displaystyle \epsilon ^{2}/4}Con eso, podemos recuperarnosμ{\displaystyle \mu }al ejecutar la ecuación del calor hacia atrás en el tiempo paraϵ2/4{\displaystyle \epsilon ^{2}/4}.

En el artículo se encuentran más ejemplos de aumentos de datos invertibles. [ 48 ]

SinGAN

SinGAN lleva el aumento de datos al límite, utilizando una sola imagen como datos de entrenamiento y aplicando el aumento de datos sobre ella. La arquitectura GAN se adapta a este método de entrenamiento mediante una canalización multiescala.

El generadorGRAMO{\displaystyle G}se descompone en una pirámide de generadoresGRAMO=GRAMO1GRAMO2GRAMOnorte{\displaystyle G=G_{1}\circ G_{2}\circ \cdots \circ G_{N}}, siendo el más bajo el que genera la imagenGRAMOnorte(znorte){\displaystyle G_{N}(z_{N})}a la resolución más baja, luego la imagen generada se amplía ar(GRAMOnorte(znorte)){\displaystyle r(G_{N}(z_{N}))}y se pasa al siguiente nivel para generar una imagen.GRAMOnorte1(znorte1+r(GRAMOnorte(znorte))){\displaystyle G_{N-1}(z_{N-1}+r(G_{N}(z_{N})))}a mayor resolución, y así sucesivamente. El discriminador también se descompone en una pirámide. [ 49 ]

Serie StyleGAN

La familia StyleGAN es una serie de arquitecturas publicadas por la división de investigación de Nvidia .

GAN progresiva

GAN progresiva [ 15 ] es un método para entrenar GAN para la generación de imágenes a gran escala de forma estable, haciendo crecer un generador GAN de pequeña a gran escala de forma piramidal. Al igual que SinGAN, descompone el generador comoGRAMO=GRAMO1GRAMO2GRAMOnorte{\displaystyle G=G_{1}\circ G_{2}\circ \cdots \circ G_{N}}y el discriminador comoD=D1D2Dnorte{\displaystyle D=D_{1}\circ D_{2}\circ \cdots \circ D_{N}}.

Durante el entrenamiento, al principio soloGRAMOnorte,Dnorte{\displaystyle G_{N},D_{N}}se utilizan en un juego GAN para generar imágenes de 4x4.GRAMOnorte1,Dnorte1{\displaystyle G_{N-1},D_{N-1}}se añaden para llegar a la segunda etapa del juego GAN, para generar imágenes de 8x8, y así sucesivamente, hasta que llegamos a un juego GAN para generar imágenes de 1024x1024.

Para evitar choques entre las etapas del juego GAN, cada nueva capa se "integra" (Figura 2 del artículo [ 15 ] ). Por ejemplo, así es como comienza la segunda etapa del juego GAN:

  • Justo antes, el juego GAN consta del parGRAMOnorte,Dnorte{\displaystyle G_{N},D_{N}}Generación y discriminación de imágenes de 4x4.
  • Justo después, el juego GAN consta del par((1α)+αGRAMOnorte1)GRAMOnorte,Dnorted((1α)+αDnorte1){\displaystyle ((1-\alpha )+\alpha \cdot G_{N-1})\circ u\circ G_{N},D_{N}\circ d\circ ((1-\alpha )+\alpha \cdot D_{N-1})}Generación y discriminación de imágenes de 8x8. Aquí, las funciones,d{\displaystyle u,d}son funciones de sobremuestreo y submuestreo de imágenes, yα{\displaystyle \alpha }es un factor de fusión (muy parecido a un alfa en la composición de imágenes) que se desliza suavemente de 0 a 1.

StyleGAN-1

La arquitectura principal de StyleGAN-1 y StyleGAN-2

StyleGAN-1 está diseñado como una combinación de GAN progresiva con transferencia de estilo neuronal . [ 50 ]

La elección arquitectónica clave de StyleGAN-1 es un mecanismo de crecimiento progresivo, similar a Progressive GAN. Cada imagen generada comienza como una constante4×4×512{\displaystyle 4\times 4\times 512}El array se pasa repetidamente a través de bloques de estilo. Cada bloque de estilo aplica un "vector latente de estilo" mediante una transformación afín ("normalización de instancia adaptativa"), de forma similar a como la transferencia de estilo neuronal utiliza la matriz de Gram . A continuación, se añade ruido y se normaliza (se resta la media y se divide por la varianza).

Durante el entrenamiento, normalmente solo se utiliza un vector latente de estilo por imagen generada, pero a veces dos ("regularización mixta") para animar a cada bloque de estilo a realizar su estilización de forma independiente sin esperar ayuda de otros bloques de estilo (ya que podrían recibir un vector latente de estilo completamente diferente).

Tras el entrenamiento, se pueden introducir múltiples vectores latentes de estilo en cada bloque de estilo. Los que se introducen en las capas inferiores controlan los estilos a gran escala, y los que se introducen en las capas superiores controlan los estilos de detalle fino.

Mezcla de estilos entre dos imágenesincógnita,incógnita{\displaystyle x,x'}También se puede realizar. Primero, ejecute un descenso de gradiente para encontrarz,z{\displaystyle z,z'}de tal manera queGRAMO(z)incógnita,GRAMO(z)incógnita{\displaystyle G(z)\approx x,G(z')\approx x'}Esto se llama "proyectar una imagen de vuelta al espacio latente de estilo". Luego,z{\displaystyle z}se pueden alimentar a los bloques de estilo inferior, yz{\displaystyle z'}a los bloques de estilo superior, para generar una imagen compuesta que tenga el estilo a gran escala deincógnita{\displaystyle x}y el estilo de detalles finos deincógnita{\displaystyle x'}También se pueden componer varias imágenes de esta manera.

StyleGAN-2

StyleGAN-2 mejora StyleGAN-1, al usar el vector latente de estilo para transformar los pesos de la capa de convolución, resolviendo así el problema del "blob". [ 51 ]

Esto fue actualizado por StyleGAN-2-ADA ("ADA" significa "adaptativo"), [ 48 ] que utiliza aumento de datos invertible como se describió anteriormente. También ajusta la cantidad de aumento de datos aplicada comenzando en cero y aumentándola gradualmente hasta que una "heurística de sobreajuste" alcanza un nivel objetivo, de ahí el nombre "adaptativo".

StyleGAN-3

StyleGAN-3 [ 52 ] mejora StyleGAN-2 al resolver el problema de "adherencia de textura", que se puede ver en los videos oficiales. [ 53 ] Analizaron el problema mediante el teorema de muestreo de Nyquist-Shannon y argumentaron que las capas en el generador aprendieron a explotar la señal de alta frecuencia en los píxeles sobre los que operan.

Para solucionar esto, propusieron imponer filtros de paso bajo estrictos entre las capas de cada generador, de modo que este se vea obligado a operar sobre los píxeles de forma fiel a las señales continuas que representan, en lugar de tratarlos como señales discretas. Además, impusieron invariancia rotacional y traslacional mediante el uso de más filtros de señal . El StyleGAN-3 resultante es capaz de resolver el problema de la adherencia de texturas, así como de generar imágenes que rotan y se trasladan suavemente.

Otros usos

Además de para el modelado generativo y discriminativo de datos, las GAN se han utilizado para otras cosas.

Las GAN se han utilizado para el aprendizaje por transferencia con el fin de garantizar la alineación del espacio de características latentes, como en el aprendizaje por refuerzo profundo . [ 54 ] Esto funciona alimentando las incrustaciones de la tarea de origen y destino al discriminador, que intenta adivinar el contexto. La pérdida resultante se retropropaga (inversamente) a través del codificador.

Aplicaciones

Ciencia

Las moléculas generadas por GAN se validaron experimentalmente en ratones. [ 71 ] [ 72 ]

Médico

Una de las principales preocupaciones en la obtención de imágenes médicas es preservar la privacidad del paciente. Por este motivo, los investigadores suelen tener dificultades para obtener imágenes médicas para sus investigaciones. Las GAN se han utilizado para generar imágenes médicas sintéticas , como imágenes de resonancia magnética (RM) y tomografía por emisión de positrones (PET) , para abordar este problema. [ 73 ]

GAN puede utilizarse para detectar imágenes glaucomatosas , lo que ayuda al diagnóstico precoz, esencial para evitar la pérdida parcial o total de la visión. [ 74 ]

Las GAN se han utilizado para crear reconstrucciones faciales forenses de figuras históricas fallecidas. [ 75 ]

Malicioso

Imagen generada por una StyleGAN que se asemeja engañosamente a la fotografía de una persona real. Esta imagen fue generada por una StyleGAN basada en un análisis de retratos.
Otro ejemplo de un retrato generado por GAN

Se han planteado inquietudes sobre el posible uso de la síntesis de imágenes humanas basada en GAN para fines siniestros, por ejemplo, para producir fotografías y vídeos falsos, posiblemente incriminatorios. [ 76 ] Las GAN pueden utilizarse para generar fotos de perfil únicas y realistas de personas que no existen, con el fin de automatizar la creación de perfiles falsos en redes sociales. [ 77 ]

En 2019, el estado de California consideró [ 78 ] y aprobó el 3 de octubre de 2019 el proyecto de ley AB-602 , que prohíbe el uso de tecnologías de síntesis de imágenes humanas para crear pornografía falsa sin el consentimiento de las personas representadas, y el proyecto de ley AB-730 , que prohíbe la distribución de videos manipulados de un candidato político dentro de los 60 días previos a una elección. Ambos proyectos de ley fueron redactados por el asambleísta Marc Berman y firmados por el gobernador Gavin Newsom . Las leyes entraron en vigor en 2020. [ 79 ]

El programa de análisis forense de medios de DARPA estudia formas de contrarrestar los medios falsos, incluidos los producidos mediante GAN. [ 80 ]

Moda, arte y publicidad

Las GAN se pueden utilizar para generar arte; The Verge escribió en marzo de 2019 que "Las imágenes creadas por las GAN se han convertido en el aspecto definitorio del arte de IA contemporáneo". [ 81 ] Las GAN también se pueden utilizar para

Algunos han trabajado con el uso de GAN para la creatividad artística, como "red adversaria creativa". [ 87 ] [ 88 ] Una GAN, entrenada con un conjunto de 15 000 retratos de WikiArt de los siglos XIV al XIX, creó la pintura Edmond de Belamy de 2018 , que se vendió por US$432 500. [ 89 ]

Las GAN fueron utilizadas por la comunidad de modificación de videojuegos para mejorar la resolución de texturas 2D de baja resolución en videojuegos antiguos, recreándolas en resoluciones 4k o superiores mediante entrenamiento de imágenes y luego reduciéndolas para que se ajustaran a la resolución nativa del juego (similar al antialiasing por supermuestreo ). [ 90 ]

En 2020, Artbreeder se utilizó para crear al antagonista principal de la secuela de la serie web de terror psicológico Ben Drowned . Posteriormente, el autor elogió las aplicaciones GAN por su capacidad para ayudar a generar recursos para artistas independientes con presupuestos y personal limitados. [ 91 ] [ 92 ]

En mayo de 2020, investigadores de Nvidia enseñaron a un sistema de IA (denominado "GameGAN") a recrear el juego Pac-Man simplemente observándolo jugar. [ 93 ] [ 94 ]

En agosto de 2019, se creó un gran conjunto de datos que consta de 12.197 canciones MIDI, cada una con letras y melodías emparejadas, para la generación de melodías neuronales a partir de letras utilizando GAN-LSTM condicional (consulte las fuentes en GitHub AI Melody Generation from Lyrics ). [ 95 ]

Misceláneas

Las GAN se han utilizado para

  • mostrar cómo la apariencia de un individuo puede cambiar con la edad. [ 96 ]
  • reconstruir modelos 3D de objetos a partir de imágenes , [ 97 ]
  • generar objetos novedosos como nubes de puntos 3D, [ 98 ]
  • modelar patrones de movimiento en video. [ 99 ]
  • rellenar características faltantes en mapas, transferir estilos de mapas en cartografía [ 100 ] o aumentar imágenes de Street View. [ 101 ]
  • utilizar la retroalimentación para generar imágenes y reemplazar los sistemas de búsqueda de imágenes. [ 102 ]
  • Visualice el efecto que el cambio climático tendrá en casas específicas. [ 103 ]
  • reconstruir una imagen del rostro de una persona después de escuchar su voz. [ 104 ]
  • produce vídeos de una persona hablando, a partir de una sola foto de esa persona. [ 105 ]
  • generación de secuencias recurrentes. [ 106 ]

Historia

En 1991, Juergen Schmidhuber publicó "Curiosidad artificial", redes neuronales en un juego de suma cero . [ 107 ] La primera red es un modelo generativo que modela una distribución de probabilidad sobre patrones de salida. La segunda red aprende mediante descenso de gradiente para predecir las reacciones del entorno a estos patrones. Las GAN pueden considerarse un caso en el que la reacción ambiental es 1 o 0 dependiendo de si la salida de la primera red está en un conjunto dado. [ 108 ]

Otras personas tuvieron ideas similares, pero no las desarrollaron de la misma manera. Una idea que involucraba redes antagónicas fue publicada en una entrada de blog de Olli Niemitalo en 2010. [ 109 ] Esta idea nunca se implementó y no incluía estocasticidad en el generador, por lo que no era un modelo generativo. Una idea similar a las GAN fue utilizada para modelar el comportamiento animal por Wei Li, Melvin Gauci y Roderich Gross en 2013. [ 110 ]

Otra inspiración para las GAN fue la estimación de contraste de ruido, [ 111 ] que utiliza la misma función de pérdida que las GAN y que Goodfellow estudió durante su doctorado en 2010-2014.

El aprendizaje automático adversario tiene otros usos además del modelado generativo y puede aplicarse a modelos distintos de las redes neuronales. En teoría de control, el aprendizaje adversario basado en redes neuronales se utilizó en 2006 para entrenar controladores robustos en un sentido de teoría de juegos, alternando las iteraciones entre una política minimizadora (el controlador) y una política maximizadora (la perturbación). [ 112 ] [ 113 ]

En 2017, se utilizó una GAN para la mejora de imágenes, centrándose en texturas realistas en lugar de la precisión de píxeles, lo que produjo una mayor calidad de imagen a gran aumento. [ 114 ] En 2017, se generaron los primeros rostros. [ 115 ] Estos se exhibieron en febrero de 2018 en el Grand Palais. [ 116 ] [ 117 ] Los rostros generados por StyleGAN [ 118 ] en 2019 generaron comparaciones con Deepfakes . [ 119 ] [ 120 ] [ 121 ]

Véase también

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). Generative Adversarial Nets (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 . 
  2. Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi (2016). "Técnicas mejoradas para entrenar GANs". arXiv : 1606.03498 [ cs.LG ].
  3. Isola, Phillip; Zhu, Jun-Yan; Zhou, Tinghui; Efros, Alexei (2017). "Traducción de imagen a imagen con redes adversarias condicionales" . Visión por computadora y reconocimiento de patrones .
  4. Ho, Jonathon; Ermon, Stefano (2016). "Aprendizaje de imitación adversarial generativo" . Advances in Neural Information Processing Systems . 29 : 4565–4573 . arXiv : 1606.03476 .
  5. "Vanilla GAN (GANs en visión artificial: Introducción al aprendizaje generativo)" . theaisummer.com . AI Summer. 10 de abril de 2020. Archivado del original el 3 de junio de 2020. Consultado el 20 de septiembre de 2020 .
  6. Luc, Pauline; Couprie, Camille ; Chintala, Soumith; Verbeek, Jakob (25 de noviembre de 2016). "Segmentación semántica mediante redes adversarias". Taller NIPS sobre entrenamiento adversario, diciembre, Barcelona, ​​España . 2016. arXiv : 1611.08408 .
  7. Andrej Karpathy ; Pieter Abbeel ; Greg Brockman; Peter Chen; Vicki Cheung; Rocky Duan; Ian Goodfellow; Durk Kingma; Jonathan Ho; Rein Houthooft; Tim Salimans; John Schulman; Ilya Sutskever; Wojciech Zaremba, Generative Models , OpenAI , consultado el 7 de abril de 2016
  8. Mohamed, Shakir; Lakshminarayanan, Balaji (2016). "Aprendizaje en modelos generativos implícitos". arXiv : 1610.03483 [ stat.ML ].
  9. Goodfellow, Ian (3 de abril de 2017). "Tutorial de NIPS 2016: Redes generativas adversarias". arXiv : 1701.00160 [ cs.LG ].
  10. Kingma, Diederik P.; Welling, Max (2019). "Una introducción a los autoencoders variacionales". Fundamentos y tendencias en aprendizaje automático . 12 (4): 307– 392. arXiv : 1906.02691 . doi : 10.1561/2200000056 .
  11. Kingma, Diederik P.; Welling, Max (1 de mayo de 2014). "Auto-Encoding Variational Bayes". arXiv : 1312.6114 [ stat.ML ].
  12. Rezende, Danilo Jimenez; Mohamed, Shakir; Wierstra, Daan (2014). "Stochastic Backpropagation and Approximate Inference in Deep Generative Models". Journal of Machine Learning Research. 32 (2): 1278–1286. arXiv:1401.4082.
  13. 12Farnia, Farzan; Ozdaglar, Asuman (November 21, 2020). "Do GANs always have Nash equilibria?". Proceedings of the 37th International Conference on Machine Learning. Vol. 119. PMLR. pp. 3029–3039.
  14. 123Weng, Lilian (April 18, 2019). "From GAN to WGAN". arXiv:1904.08994 [cs.LG].
  15. 123Karras, Tero; Aila, Timo; Laine, Samuli; Lehtinen, Jaakko (October 1, 2017). "Progressive Growing of GANs for Improved Quality, Stability, and Variation". arXiv:1710.10196 [cs.NE].
  16. Soviany, Petru; Ardei, Claudiu; Ionescu, Radu Tudor; Leordeanu, Marius (October 22, 2019). "Image Difficulty Curriculum for Generative Adversarial Networks (CuGAN)". arXiv:1910.08967 [cs.LG].
  17. Hacohen, Guy; Weinshall, Daphna (May 24, 2019). "On The Power of Curriculum Learning in Training Deep Networks". International Conference on Machine Learning. PMLR: 2535–2544. arXiv:1904.03626.
  18. Lin, Zinan; et al. (December 2018). PacGAN: the power of two samples in generative adversarial networks. 32nd International Conference on Neural Information Processing Systems. pp. 1505–1514. arXiv:1712.04086.
  19. Mescheder, Lars; Geiger, Andreas; Nowozin, Sebastian (July 31, 2018). "Which Training Methods for GANs do actually Converge?". arXiv:1801.04406 [cs.LG].
  20. 12Brock, Andrew; Donahue, Jeff; Simonyan, Karen (September 1, 2018). Large Scale GAN Training for High Fidelity Natural Image Synthesis. International Conference on Learning Representations 2019. arXiv:1809.11096.
  21. Heusel, Martin; Ramsauer, Hubert; Unterthiner, Thomas; Nessler, Bernhard; Hochreiter, Sepp (2017). "GANs entrenadas mediante una regla de actualización de dos escalas de tiempo convergen a un equilibrio de Nash local" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. arXiv : 1706.08500 .
  22. Zhang, Richard; Isola, Phillip; Efros, Alexei A.; Shechtman, Eli; Wang, Oliver (2018). "La irrazonable efectividad de las características profundas como métrica perceptual". pp. 586– 595. arXiv : 1801.03924 [ cs.CV ]. 
  23. Borji, Ali (1 de febrero de 2019). "Ventajas y desventajas de las medidas de evaluación de GAN" . Computer Vision and Image Understanding . 179 : 41–65 . arXiv : 1802.03446 . Bibcode : 2019CVIU..179...41B . doi : 10.1016/j.cviu.2018.10.009 . ISSN 1077-3142 . S2CID 3627712 .  
  24. ^ Hindupur, Avinash (15 de julio de 2022), The GAN Zoo , consultado el 15 de julio de 2022
  25. Odena, Augustus; Olah, Christopher; Shlens, Jonathon (17 de julio de 2017). "Síntesis condicional de imágenes con GANs de clasificadores auxiliares" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2642–2651 . arXiv : 1610.09585 .
  26. Radford, Alec; Metz, Luke; Chintala, Soumith (2016). "Aprendizaje de representación no supervisado con redes generativas adversarias convolucionales profundas". ICLR . S2CID 11758569 . 
  27. Long, Jonathan; Shelhamer, Evan; Darrell, Trevor (2015). "Redes totalmente convolucionales para la segmentación semántica" . CVF : 3431–3440 .
  28. Zhang, Han; Goodfellow, Ian; Metaxas, Dimitris; Odena, Augustus (24 de mayo de 2019). "Redes generativas adversarias de autoatención" . Conferencia Internacional sobre Aprendizaje Automático . PMLR: 7354–7363 .
  29. ^ Larsen, Anders Boesen Lindbo; Sønderby, Søren Kaae; Larochelle, Hugo; Winther, Ole (11 de junio de 2016). "Codificación automática más allá de los píxeles utilizando una métrica de similitud aprendida" . Congreso Internacional sobre Aprendizaje Automático . PMLR: 1558–1566 . arXiv : 1512.09300 .
  30. Jiang, Yifan; Chang, Shiyu; Wang, Zhangyang (8 de diciembre de 2021). "TransGAN: Dos transformadores puros pueden crear una GAN fuerte y escalable". arXiv : 2102.07074 [ cs.CV ].
  31. Grover, Aditya; Dhar, Manik; Ermon, Stefano (1 de mayo de 2017). "Flow-GAN: Combinando máxima verosimilitud y aprendizaje adversario en modelos generativos". arXiv : 1705.08868 [ cs.LG ].
  32. Arjovsky, Martin; Bottou, Léon (1 de enero de 2017). "Hacia métodos basados ​​en principios para el entrenamiento de redes generativas adversarias". arXiv : 1701.04862 [ stat.ML ].
  33. Goodfellow, Ian J. (1 de diciembre de 2014). "Sobre los criterios de distinguibilidad para estimar modelos generativos". arXiv : 1412.6515 [ stat.ML ].
  34. Goodfellow, Ian (31 de agosto de 2016). "Redes generativas antagónicas (GAN), presentación en el Laboratorio de Inteligencia Artificial de Berkeley" (PDF) . Archivado (PDF) del original el 8 de mayo de 2022.
  35. Lim, Jae Hyun; Ye, Jong Chul (8 de mayo de 2017). "GAN geométrica". arXiv : 1705.02894 [ estad.ML ].
  36. Mao, Xudong; Li, Qing; Xie, Haoran; Lau, Raymond YK; Wang, Zhen; Paul Smolley, Stephen (2017). "Redes generativas adversarias de mínimos cuadrados" . 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 2794–2802 . arXiv : 1611.04076 . doi : 10.1109/ICCV.2017.304 . ISBN  978-1-5386-1032-9.
  37. Makhzani, Alireza; Shlens, Jonathon; Jaitly, Navdeep; Goodfellow, Ian ; Frey, Brendan (2016). "Autoencoders adversariales". arXiv : 1511.05644 [ cs.LG ].
  38. Barber, David; Agakov, Felix (9 de diciembre de 2003). "El algoritmo IM: un enfoque variacional para la maximización de la información" . Actas de la 16.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'03. Cambridge, MA, EE. UU.: MIT Press: 201–208 .
  39. Chen, Xi; Duan, Yan; Houthooft, Rein; Schulman, John; Sutskever, Ilya; Abbeel, Pieter (2016). "InfoGAN: Aprendizaje de representación interpretable mediante redes generativas adversarias que maximizan la información" . Advances in Neural Information Processing Systems . 29. Curran Associates, Inc. arXiv : 1606.03657 .
  40. ^ Donahue, Jeff; Krähenbühl, Philipp; Darrell, Trevor (2016). "Aprendizaje de funciones adversas". arXiv : 1605.09782 [ cs.LG ].
  41. Dumoulin, Vincent; Belghazi, Ishmael; Poole, Ben; Mastropietro, Olivier; Arjovsky, Alex; Courville, Aaron (2016). "Inferencia aprendida adversariamente". arXiv : 1606.00704 [ stat.ML ].
  42. Xi Chen; Yan Duan; Rein Houthooft; John Schulman; Ilya Sutskever ; Pieter Abeel (2016). "InfoGAN: Aprendizaje de representación interpretable mediante redes generativas adversarias que maximizan la información". arXiv : 1606.03657 [ cs.LG ].
  43. Zhirui Zhang; Shujie Liu; Mu Li; Ming Zhou; Enhong Chen (octubre de 2018). "Redes generativas adversarias bidireccionales para la traducción automática neuronal" (PDF) . págs. 190–199 . 
  44. Zhu, Jun-Yan; Park, Taesung; Isola, Phillip; Efros, Alexei A. (2017). "Traducción de imagen a imagen sin pares mediante redes adversarias con consistencia cíclica". pp. 2223– 2232. arXiv : 1703.10593 [ cs.CV ]. 
  45. Isola, Phillip; Zhu, Jun-Yan; Zhou, Tinghui; Efros, Alexei A. (2017). "Traducción de imagen a imagen con redes adversarias condicionales". pp. 1125– 1134. arXiv : 1611.07004 [ cs.CV ]. 
  46. Brownlee, Jason (22 de agosto de 2019). "Una introducción sencilla a BigGAN, la gran red generativa antagónica" . Machine Learning Mastery . Recuperado el 15 de julio de 2022 .
  47. Shengyu, Zhao; Zhijian, Liu; Ji, Lin; Jun-Yan, Zhu; Song, Han (2020). " Aumento diferenciable para el entrenamiento eficiente de GAN con datos" . Advances in Neural Information Processing Systems . 33. arXiv : 2006.10738 .
  48. 1 2 3 Tero, Karras; Miika, Aittala; Janne, Hellsten; Samuli, Laine; Jaakko, Lehtinen; Timo, Aila (2020). "Capacitación de redes generativas adversarias con datos limitados" . Avances en los sistemas de procesamiento de información neuronal . 33 .
  49. Shaham, Tamar Rott; Dekel, Tali; Michaeli, Tomer (octubre de 2019). "SinGAN: Aprendizaje de un modelo generativo a partir de una sola imagen natural" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 4569–4579 . arXiv : 1905.01164 . doi : 10.1109/iccv.2019.00467 . ISBN  978-1-7281-4803-8. S2CID 145052179 . 
  50. Karras, Tero; Laine, Samuli; Aila, Timo (junio de 2019). "Una arquitectura de generador basada en estilos para redes generativas adversarias" . Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 4396–4405 . arXiv : 1812.04948 . doi : 10.1109/cvpr.2019.00453 . ISBN  978-1-7281-3293-8. S2CID 54482423 . 
  51. Karras, Tero; Laine, Samuli; Aittala, Miika; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo (junio de 2020). "Análisis y mejora de la calidad de imagen de StyleGAN" . Conferencia IEEE/CVF 2020 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 8107–8116 . arXiv : 1912.04958 . doi : 10.1109/cvpr42600.2020.00813 . ISBN  978-1-7281-7168-5. S2CID 209202273 . 
  52. Timo, Karras, Tero Aittala, Miika Laine, Samuli Härkönen, Erik Hellsten, Janne Lehtinen, Jaakko Aila (23 de junio de 2021). Redes adversarias generativas sin alias . OCLC 1269560084 . {{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  53. Karras, Tero; Aittala, Miika; Laine, Samuli; Härkönen, Erik; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo. "Redes adversarias generativas sin alias (StyleGAN3)" . nvlabs.github.io . Consultado el 16 de julio de 2022 .
  54. ^ Li, Bonnie; François-Lavet, Vicente; Doan, Thang; Pineau, Joelle (14 de febrero de 2021). "Aprendizaje por refuerzo de dominio adversario". arXiv : 2102.07097 [ cs.LG ].
  55. Schawinski, Kevin; Zhang, Ce; Zhang, Hantian; Fowler, Lucas; Santhanam, Gokula Krishnan (1 de febrero de 2017). "Las redes generativas adversarias recuperan características en imágenes astrofísicas de galaxias más allá del límite de deconvolución" . Monthly Notices of the Royal Astronomical Society: Letters . 467 (1): L110– L114. arXiv : 1702.00403 . Bibcode : 2017MNRAS.467L.110S . doi : 10.1093/mnrasl/slx008 . S2CID 7213940 . 
  56. Kincade, Kathy. "Investigadores entrenan una red neuronal para estudiar la materia oscura" . Revista R&D.
  57. Kincade, Kathy (16 de mayo de 2019). "CosmoGAN: Entrenamiento de una red neuronal para estudiar la materia oscura" . Phys.org .
  58. "Entrenamiento de una red neuronal para estudiar la materia oscura" . Science Daily . 16 de mayo de 2019.
  59. a las 06:13, Katyanna Quach, 20 de mayo de 2019. "Los cosmopolitas usan redes neuronales para construir mapas de materia oscura de forma sencilla" . www.theregister.co.uk . Consultado el 20 de mayo de 2019 .{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  60. Mustafa, Mustafa; Bard, Deborah; Bhimji, Wahid; Lukić, Zarija; Al-Rfou, Rami; Kratochvil, Jan M. (6 de mayo de 2019). "CosmoGAN: creación de mapas de convergencia de lentes débiles de alta fidelidad mediante redes generativas adversarias" . Astrofísica computacional y cosmología . 6 (1) 1. arXiv : 1706.02390 . Bibcode : 2019ComAC...6....1M . doi : 10.1186/s40668-019-0029-9 . ISSN 2197-7909 . S2CID 126034204 .  
  61. Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2017). "Aprendizaje de física de partículas mediante ejemplos: redes generativas adversarias con conciencia de la ubicación para la síntesis de física". Computing and Software for Big Science . 1 (1): 4. arXiv : 1701.05927 . Bibcode : 2017CSBS....1....4D . doi : 10.1007/s41781-017-0004-6 . S2CID 88514467 . 
  62. Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2018). "Acelerando la ciencia con redes generativas adversarias: una aplicación a cascadas de partículas 3D en calorímetros multicapa". Physical Review Letters . 120 (4) 042003. arXiv : 1705.02355 . Bibcode : 2018PhRvL.120d2003P . doi : 10.1103/PhysRevLett.120.042003 . PMID 29437460 . S2CID 3330974 .  
  63. Paganini, Michela; de Oliveira, Luke; Nachman, Benjamin (2018). "CaloGAN: Simulación de cascadas de partículas de alta energía en 3D en calorímetros electromagnéticos multicapa con redes generativas adversarias". Phys. Rev. D . 97 (1) 014021. arXiv : 1712.10321 . Bibcode : 2018PhRvD..97a4021P . doi : 10.1103/PhysRevD.97.014021 . S2CID 41265836 . 
  64. Erdmann, Martin; Glombitza, Jonas; Quast, Thorben (2019). "Simulación precisa de cascadas de calorímetros electromagnéticos utilizando una red generativa adversaria de Wasserstein". Computing and Software for Big Science . 3 (1): 4. arXiv : 1807.01954 . Bibcode : 2019CSBS....3....4E . doi : 10.1007/s41781-018-0019-7 . S2CID 54216502 . 
  65. Musella, Pasquale; Pandolfi, Francesco (2018). "Simulación rápida y precisa de detectores de partículas mediante redes generativas adversarias". Computing and Software for Big Science . 2 (1): 8. arXiv : 1805.00850 . Bibcode : 2018CSBS....2....8M . doi : 10.1007/s41781-018-0015-y . S2CID 119474793 . 
  66. "Modelos generativos profundos para la simulación rápida de cascadas en ATLAS" . 2018.
  67. SHiP, Colaboración (2019). "Simulación rápida de muones producidos en el experimento SHiP utilizando redes generativas adversarias". Journal of Instrumentation . 14 (11) 11028. arXiv : 1909.04451 . Bibcode : 2019JInst..14P1028A . doi : 10.1088/1748-0221/14/11/P11028 . S2CID 202542604 . 
  68. Nista, Ludovico; Pitsch, Heinz; Schumann, Christoph DK; Bode, Mathis; Grenga, Temistocle; MacArt, Jonathan F.; Attili, Antonio (4 de junio de 2024). "Influencia del entrenamiento adversario en la reconstrucción de turbulencia de superresolución" . Physical Review Fluids . 9 (6) 064601. arXiv : 2308.16015 . Bibcode : 2024PhRvF...9f4601N . doi : 10.1103/PhysRevFluids.9.064601 .
  69. Nista, L.; Schumann, CDK; Grenga, T.; Attili, A.; Pitsch, H. (1 de enero de 2023). "Investigación de la capacidad de generalización de una red generativa adversaria para la simulación de grandes remolinos de flujos reactivos premezclados turbulentos" . Actas del Instituto de Combustión . 39 (4): 5279– 5288. Bibcode : 2023PComI..39.5279N . doi : 10.1016/j.proci.2022.07.244 . hdl : 20.500.11820/d36801a4-ead5-4379-92a4-020a509112ec . ISSN 1540-7489 . 
  70. Fukami, Kai; Fukagata, Koji; Taira, Kunihiko (1 de agosto de 2020). "Evaluación de métodos de aprendizaje automático supervisado para flujos de fluidos". Dinámica de fluidos teórica y computacional . 34 (4): 497– 519. arXiv : 2001.09618 . Bibcode : 2020ThCFD..34..497F . doi : 10.1007/s00162-020-00518-y . ISSN 1432-2250 . 
  71. Zhavoronkov, Alex (2019). "El aprendizaje profundo permite la identificación rápida de potentes inhibidores de la quinasa DDR1". Nature Biotechnology . 37 (9): 1038– 1040. doi : 10.1038/s41587-019-0224-x . PMID 31477924 . S2CID 201716327 .  
  72. Barber, Gregory. "Una molécula diseñada por IA exhibe cualidades "similares a las de un fármaco" . Wired .
  73. Moradi, M; Demirel, H (2024). "Clasificación de la enfermedad de Alzheimer mediante selección de datos basada en GAN condicional progresiva 3D y LDA". Procesamiento de señales, imágenes y vídeo . 18 (2): 1847– 1861. doi : 10.1007/s11760-023-02878-4 .
  74. Bisneto, Tomaz Ribeiro Viana; de Carvalho Filho, Antonio Oseas; Magalhães, Deborah Maria Vieira (febrero de 2020). "Características de textura y red adversaria generativa aplicadas a la detección automática de glaucoma". Computación blanda aplicada . 90 106165.doi : 10.1016/ j.asoc.2020.106165 . S2CID 214571484 . 
  75. Reconstrucción de los emperadores romanos: Entrevista con Daniel Voshart , 16 de noviembre de 2020 , consultado el 3 de junio de 2022
  76. msmash (14 de febrero de 2019).El sitio web 'This Person Does Not Exist' utiliza IA para crear rostros realistas pero aterradores . Slashdot . Consultado el 16 de febrero de 2019 .
  77. Doyle, Michael (16 de mayo de 2019). "John Beasley vive en Saddlehorse Drive en Evansville. ¿O no?" . Courier and Press.
  78. Targett, Ed (16 de mayo de 2019). "California se acerca a ilegalizar la pornografía deepfake". Computer Business Review.
  79. Mihalcik, Carrie (4 de octubre de 2019). "Las leyes de California buscan reprimir los deepfakes en la política y la pornografía" . cnet.com . CNET . Consultado el 13 de octubre de 2019 .
  80. Knight, Will (7 de agosto de 2018). "El Departamento de Defensa ha producido las primeras herramientas para detectar deepfakes" . MIT Technology Review .
  81. Vincent, James (5 de marzo de 2019). "Un flujo interminable de arte creado con IA sale a subasta" . The Verge . Consultado el 13 de junio de 2020 .
  82. Yu, Jiahui, et al. " Relleno de imágenes generativo con atención contextual ". Actas de la conferencia IEEE sobre visión por computadora y reconocimiento de patrones. 2018.
  83. Wong, Ceecee (27 de mayo de 2019). "El auge de las supermodelos de IA" . CDO Trends .
  84. Taif, K.; Ugail, H.; Mehmood, I. (2020). "Generación de sombras proyectadas mediante redes generativas adversarias". Ciencia Computacional – ICCS 2020. Notas de clase en Ciencias de la Computación. Vol. 12141. pp. 481–495 . doi : 10.1007/978-3-030-50426-7_36 . ISBN   978-3-030-50425-0. PMC 7302543 . 
  85. Wei, Jerry (3 de julio de 2019). "Generación de diseños de zapatos con aprendizaje automático" . Medium . Archivado del original el 30 de abril de 2020. Recuperado el 6 de noviembre de 2019 .
  86. Greenemeier, Larry (20 de junio de 2016). "¿Cuándo tendrán sentido común las computadoras? Pregúntenle a Facebook" . Scientific American . Recuperado el 31 de julio de 2016 .
  87. Elgammal, Ahmed; Liu, Bingchen; Elhoseiny, Mohamed; Mazzone, Marian (2017). "CAN: Creative Adversarial Networks, Generating "Art" by Learning About Styles and Deviating from Style Norms". arXiv : 1706.07068 [ cs.AI ].
  88. Mazzone, Marian; Ahmed Elgammal (21 de febrero de 2019). "Arte, creatividad y el potencial de la inteligencia artificial" . Arts . 8 : 26. doi : 10.3390/arts8010026 .
  89. Cohn, Gabe (25 de octubre de 2018). "Arte con IA en Christie's se vende por 432.500 dólares" . The New York Times .
  90. ^ Tang, Xiaoou; Qiao, Yu; Loy, Chen Cambio; Dong, Chao; Liu, Yihao; Gu, Jinjin; Wu, Shixiang; Yu, Ke; Wang, Xintao (1 de septiembre de 2018). "ESRGAN: redes adversas generativas de superresolución mejoradas". arXiv : 1809.00219 [ cs.CV ].
  91. Allen, Eric Van (8 de julio de 2020). "Una infame saga de creepypastas de Zelda utiliza inteligencia artificial para crear su final" . USgamer . Archivado del original el 7 de noviembre de 2022. Recuperado el 7 de noviembre de 2022 .
  92. arcadeattack (28 de septiembre de 2020). "Arcade Attack Podcast – Septiembre (4 de 4) 2020 - Alex Hall (Ben Drowned) - Entrevista" . Arcade Attack . Consultado el 7 de noviembre de 2022 .
  93. "La IA de Nvidia recrea Pac-Man desde cero con solo observar cómo se juega" . The Verge . 22 de mayo de 2020.
  94. Seung Wook Kim; Zhou, Yuhao; Philion, Jonah; Torralba, Antonio; Fidler, Sanja (2020). "Aprendizaje para simular entornos dinámicos con GameGAN". arXiv : 2005.12126 [ cs.CV ].
  95. Yu, Yi; Canales, Simon (2021). "LSTM-GAN condicional para la generación de melodías a partir de letras". ACM Transactions on Multimedia Computing, Communications, and Applications . 17 : 1–20 . arXiv : 1908.05551 . doi : 10.1145/3424116 . ISSN 1551-6857 . S2CID 199668828 .  
  96. Antipov, Grigory; Baccouche, Moez; Dugelay, Jean-Luc (2017). "Envejecimiento facial con redes generativas adversarias condicionales". arXiv : 1702.01983 [ cs.CV ].
  97. "Red Generativa Adversaria 3D" . 3dgan.csail.mit.edu .
  98. Achlioptas, Panos; Diamanti, Olga; Mitliagkas, Ioannis; Guibas, Leonidas (2018). "Aprendizaje de representaciones y modelos generativos para nubes de puntos 3D". arXiv : 1707.02392 [ cs.CV ].
  99. Vondrick, Carl; Pirsiavash, Hamed; Torralba, Antonio (2016). "Generación de vídeos con dinámica de escena" . carlvondrick.com . arXiv : 1609.02612 . Bibcode : 2016arXiv160902612V .
  100. Kang, Yuhao; Gao, Song; Roth, Rob (2019). "Transferencia de estilos de mapas multiescala mediante redes generativas adversarias" . Revista Internacional de Cartografía . 5 ( 2–3 ): 115–141 . arXiv : 1905.02200 . Bibcode : 2019IJCar...5..115K . doi : 10.1080/23729333.2019.1615729 . S2CID 146808465 . 
  101. Wijnands, Jasper; Nice, Kerry; Thompson, Jason; Zhao, Haifeng; Stevenson, Mark (2019). "Aumento del paisaje urbano mediante redes generativas adversarias: perspectivas relacionadas con la salud y el bienestar". Sustainable Cities and Society . 49 101602. arXiv : 1905.06464 . Bibcode : 2019SusCS..4901602W . doi : 10.1016/j.scs.2019.101602 . S2CID 155100183 . 
  102. Ukkonen, Antti; Joona, Pyry; Ruotsalo, Tuukka (2020). "Generando imágenes en lugar de recuperarlas" . Actas de la 43.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . págs. 1329–1338 . doi : 10.1145/3397271.3401129 . hdl : 10138/328471 . ISBN  978-1-4503-8016-4. S2CID 220730163 . 
  103. "La IA puede mostrarnos los estragos del cambio climático" . MIT Technology Review . 16 de mayo de 2019.
  104. Christian, Jon (28 de mayo de 2019). "ASOMBROSA IA ADIVINA TU APARIENCIA BASÁNDOSE EN TU VOZ" . Futurismo.
  105. Kulp, Patrick (23 de mayo de 2019). "El laboratorio de IA de Samsung puede crear imágenes de vídeo falsas a partir de una sola foto de la cabeza" . AdWeek .
  106. Mohammad Navid Fekri; Ananda Mohon Ghosh; Katarina Grolinger (2020). "Generación de datos energéticos para aprendizaje automático con redes generativas adversarias recurrentes" . Energies . 13 (1): 130. doi : 10.3390/en13010130 .
  107. Schmidhuber, Jürgen (1991). "Una posibilidad para implementar la curiosidad y el aburrimiento en controladores neuronales de modelado". Proc. SAB'1991 . MIT Press/Bradford Books. pp. 222–227 . 
  108. Schmidhuber, Jürgen (2020). "Las redes generativas adversarias son casos especiales de curiosidad artificial (1990) y también están estrechamente relacionadas con la minimización de la predictibilidad (1991)". Redes neuronales . 127 : 58–66 . arXiv : 1906.04493 . doi : 10.1016/j.neunet.2020.04.008 . PMID 32334341. S2CID 216056336 .  
  109. Niemitalo, Olli (24 de febrero de 2010). "Un método para entrenar redes neuronales artificiales para generar datos faltantes dentro de un contexto variable" . Internet Archive (Wayback Machine) . Archivado del original el 12 de marzo de 2012. Recuperado el 22 de febrero de 2019 .
  110. Li, Wei; Gauci, Melvin; Gross, Roderich (6 de julio de 2013). «Actas de la decimoquinta conferencia anual sobre computación genética y evolutiva - GECCO '13». Actas de la 15.ª Conferencia Anual sobre Computación Genética y Evolutiva (GECCO 2013) . Ámsterdam, Países Bajos: ACM. págs. 223-230 . doi : 10.1145/2463372.2465801 . ISBN  978-1-4503-1963-8.
  111. Gutmann, Michael; Hyvärinen, Aapo. "Estimación de contraste de ruido" (PDF) . Conferencia internacional sobre IA y estadística .
  112. Abu-Khalaf, Murad; Lewis, Frank L.; Huang, Jie (1 de julio de 2008). "Programación neurodinámica y juegos de suma cero para sistemas de control con restricciones". IEEE Transactions on Neural Networks . 19 (7): 1243– 1252. Bibcode : 2008ITNN...19.1243A . doi : 10.1109/TNN.2008.2000204 . S2CID 15680448 . 
  113. Abu-Khalaf, Murad; Lewis, Frank L.; Huang, Jie (1 de diciembre de 2006). "Iteraciones de política en la ecuación de Hamilton-Jacobi-Isaacs para el control de retroalimentación de estado H con saturación de entrada". IEEE Transactions on Automatic Control . doi : 10.1109/TAC.2006.884959 . S2CID 1338976 . 
  114. Sajjadi, Mehdi SM; Schölkopf, Bernhard; Hirsch, Michael (23 de diciembre de 2016). "EnhanceNet: Superresolución de imagen única mediante síntesis de textura automatizada". arXiv : 1612.07919 [ cs.CV ].
  115. "Esta persona no existe: con la IA, nada existirá eventualmente" . 20 de marzo de 2019.
  116. "La inteligencia artificial entra en la historia del arte" . 28 de diciembre de 2018.
  117. Tom Février (17 de febrero de 2019). "El escándalo de la inteligencia ARTificielle" .
  118. "StyleGAN: Implementación oficial de TensorFlow" . 2 de marzo de 2019 vía GitHub.
  119. Paez, Danny (13 de febrero de 2019). "This Person Does Not Exist Is the Best One-Off Website of 2019" . Recuperado el 16 de febrero de 2019 .
  120. Beschizza, Rob (15 de febrero de 2019). "Esta persona no existe" . Boing-Boing . Consultado el 16 de febrero de 2019 .
  121. Horev, Rani (26 de diciembre de 2018). "GAN basadas en estilos: generación y ajuste de rostros artificiales realistas" . Lyrn.AI. Archivado del original el 5 de noviembre de 2020. Recuperado el 16 de febrero de 2019 .
  • Knight, Will. "5 grandes predicciones para la inteligencia artificial en 2017" . MIT Technology Review . Consultado el 5 de enero de 2017 .
  • Karras, Tero; Laine, Samuli; Aila, Timo (2018). "Una arquitectura de generador basada en estilos para redes generativas adversarias". arXiv : 1812.04948 [ cs.NE ].
  • Esta persona no existe : imágenes fotorrealistas de personas que no existen, generadas por StyleGAN. 
  • Este gato no existe. Archivado el 5 de marzo de 2019 en Wayback Machine : imágenes fotorrealistas de gatos que no existen, generadas por StyleGAN. 
  • Wang, Zhengwei; She, Qi; Ward, Tomas E. (2019). "Redes generativas adversarias en visión por computadora: una revisión y taxonomía". arXiv : 1906.01529 [ cs.LG ].