
La Red Generativa Adversaria de Estilo , o StyleGAN para abreviar, es una extensión de la arquitectura GAN introducida por investigadores de Nvidia en diciembre de 2018, [ 1 ] y cuyo código fuente se puso a disposición en febrero de 2019. [ 2 ] [ 3 ]
StyleGAN depende del software CUDA de Nvidia , las GPU y TensorFlow de Google , [ 4 ] o PyTorch de Meta AI , que reemplaza a TensorFlow como la biblioteca de implementación oficial en versiones posteriores de StyleGAN. [ 5 ] La segunda versión de StyleGAN, llamada StyleGAN2, se publicó el 5 de febrero de 2020. Elimina algunos de los artefactos característicos y mejora la calidad de la imagen. [ 6 ] [ 7 ] Nvidia presentó StyleGAN3, descrita como una versión "sin alias", el 23 de junio de 2021, y puso el código fuente a disposición el 12 de octubre de 2021. [ 8 ]
Historia
Un predecesor directo de la serie StyleGAN es Progressive GAN, publicado en 2017. [ 9 ]
En diciembre de 2018, investigadores de Nvidia distribuyeron una versión preliminar con el software correspondiente, presentando StyleGAN, una red generativa antagónica (GAN) para producir un número ilimitado de retratos (a menudo convincentes) de rostros humanos falsos . StyleGAN podía ejecutarse en los procesadores GPU estándar de Nvidia.
En febrero de 2019, el ingeniero de Uber Phillip Wang utilizó el software para crear el sitio web This Person Does Not Exist , que mostraba un rostro nuevo en cada recarga de la página. [ 10 ] [ 11 ] El propio Wang expresó su asombro, dado que los humanos evolucionaron para comprender específicamente los rostros humanos, de que, sin embargo, StyleGAN puede "descomponer de forma competitiva todas las características relevantes (de los rostros humanos) y recomponerlas de una manera coherente". [ 12 ]
En septiembre de 2019, un sitio web llamado Generated Photos publicó 100.000 imágenes como una colección de fotos de archivo . [ 13 ] La colección se creó utilizando un conjunto de datos privado tomado en un entorno controlado con luz y ángulos similares. [ 14 ]
De manera similar, dos profesores de la Escuela de Información de la Universidad de Washington utilizaron StyleGAN para crear Which Face is Real?, que desafiaba a los visitantes a diferenciar entre un rostro falso y uno real uno al lado del otro. [ 11 ] Los profesores declararon que la intención era "educar al público" sobre la existencia de esta tecnología para que pudieran desconfiar de ella, "tal como con el tiempo la mayoría de la gente se dio cuenta de que se puede retocar una imagen con Photoshop". [ 15 ]
La segunda versión de StyleGAN, llamada StyleGAN2, se publicó el 5 de febrero de 2020. Elimina algunos de los artefactos característicos y mejora la calidad de la imagen. [ 6 ] [ 7 ]
En 2021, se lanzó una tercera versión que mejoraba la coherencia entre los detalles finos y gruesos del generador. Esta versión, denominada "sin alias", se implementó con PyTorch . [ 16 ]
Uso ilícito
En diciembre de 2019, Facebook eliminó una red de cuentas con identidades falsas y mencionó que algunas de ellas habían utilizado fotos de perfil creadas con técnicas de aprendizaje automático. [ 17 ]
Arquitectura
GAN progresiva
GAN progresiva [ 9 ] es un método para entrenar GAN para la generación de imágenes a gran escala de forma estable, haciendo crecer un generador GAN de pequeña a gran escala de forma piramidal. Al igual que SinGAN, descompone el generador comoy el discriminador como.
Durante el entrenamiento, al principio solose utilizan en un juego GAN para generar imágenes de 4x4.se añaden para llegar a la segunda etapa del juego GAN, para generar imágenes de 8x8, y así sucesivamente, hasta que llegamos a un juego GAN para generar imágenes de 1024x1024.
Para evitar la discontinuidad entre las etapas del juego GAN, cada nueva capa se "integra" (Figura 2 del artículo [ 9 ] ). Por ejemplo, así es como comienza la segunda etapa del juego GAN:
- Justo antes, el juego GAN consta del parGeneración y discriminación de imágenes de 4x4.
- Justo después, el juego GAN consta del parGeneración y discriminación de imágenes de 8x8. Aquí, las funcionesson funciones de sobremuestreo y submuestreo de imágenes, yes un factor de fusión (muy parecido a un alfa en la composición de imágenes) que se desliza suavemente de 0 a 1.
StyleGAN

StyleGAN está diseñado como una combinación de GAN progresiva con transferencia de estilo neuronal . [ 18 ]
La elección arquitectónica clave de StyleGAN-1 es un mecanismo de crecimiento progresivo, similar a Progressive GAN. Cada imagen generada comienza como una constante [ nota 1 ].El array se pasa repetidamente a través de bloques de estilo. Cada bloque de estilo aplica un "vector latente de estilo" mediante una transformación afín ("normalización de instancia adaptativa"), de forma similar a como la transferencia de estilo neuronal utiliza la matriz de Gram . A continuación, se añade ruido y se normaliza (se resta la media y se divide por la varianza).
Durante el entrenamiento, normalmente solo se utiliza un vector latente de estilo por imagen generada, pero a veces dos ("regularización mixta") para animar a cada bloque de estilo a realizar su estilización de forma independiente sin esperar ayuda de otros bloques de estilo (ya que podrían recibir un vector latente de estilo completamente diferente).
Tras el entrenamiento, se pueden introducir múltiples vectores latentes de estilo en cada bloque de estilo. Los que se introducen en las capas inferiores controlan los estilos a gran escala, y los que se introducen en las capas superiores controlan los estilos de detalle fino.
Mezcla de estilos entre dos imágenesTambién se puede realizar. Primero, ejecute un descenso de gradiente para encontrarde tal manera queEsto se llama "proyectar una imagen de vuelta al espacio latente de estilo ". Luego,se pueden alimentar a los bloques de estilo inferior, ya los bloques de estilo superior, para generar una imagen compuesta que tenga el estilo a gran escala dey el estilo de detalles finos deTambién se pueden componer varias imágenes de esta manera.
StyleGAN2
StyleGAN2 mejora a StyleGAN de dos maneras.
Primero, aplica el vector latente de estilo para transformar los pesos de la capa de convolución, resolviendo así el problema del "blob". [ 19 ] El problema del "blob" se debe, en términos generales, a que usar el vector latente de estilo para normalizar la imagen generada destruye información útil. En consecuencia, el generador aprendió a crear una "distracción" mediante un gran blob, que absorbe la mayor parte del efecto de la normalización (algo similar a usar bengalas para distraer un misil teledirigido ).
En segundo lugar, utiliza conexiones residuales, lo que ayuda a evitar el fenómeno en el que ciertas características se quedan atascadas en intervalos de píxeles. Por ejemplo, la unión entre dos dientes puede quedarse atascada en píxeles divisibles por 32, porque el generador aprendió a generar dientes durante la etapa N-5 y, en consecuencia, solo pudo generar dientes primitivos en esa etapa, antes de escalar 5 veces (es decir, intervalos de 32).
Esto fue actualizado por StyleGAN2-ADA ("ADA" significa "adaptativo"), [ 20 ] que utiliza aumento de datos invertible . También ajusta la cantidad de aumento de datos aplicada comenzando en cero y aumentándola gradualmente hasta que una " heurística de sobreajuste " alcanza un nivel objetivo, de ahí el nombre "adaptativo".
EstiloGAN3
StyleGAN3 [ 21 ] mejora StyleGAN2 al resolver el problema de "adherencia de textura", que se puede ver en los videos oficiales. [ 22 ] Analizaron el problema mediante el teorema de muestreo de Nyquist-Shannon y argumentaron que las capas en el generador aprendieron a explotar la señal de alta frecuencia en los píxeles sobre los que operan.
Para solucionar esto, propusieron imponer filtros de paso bajo estrictos entre las capas de cada generador, de modo que este se vea obligado a operar sobre los píxeles de forma fiel a las señales continuas que representan, en lugar de tratarlos como señales discretas. Además, impusieron invariancia rotacional y traslacional mediante el uso de más filtros de señal . El StyleGAN-3 resultante es capaz de generar imágenes que rotan y se trasladan suavemente, sin problemas de textura.
Véase también
Notas
- ↑ Se aprende durante el entrenamiento, pero después se mantiene constante, de forma muy parecida a un vector de sesgo.
Referencias
- ↑ "GAN 2.0: Generador de rostros hiperrealistas de NVIDIA" . SyncedReview.com . 14 de diciembre de 2018. Consultado el 3 de octubre de 2019 .
- ↑ "NVIDIA publica como código abierto StyleGAN, un generador de rostros hiperrealistas" . Medium.com . 9 de febrero de 2019. Consultado el 3 de octubre de 2019 .
- ↑ Beschizza, Rob (15 de febrero de 2019). "Esta persona no existe" . Boing-Boing . Consultado el 16 de febrero de 2019 .
- ↑ Larabel, Michael (10 de febrero de 2019). "NVIDIA abre el código de StyleGAN: crea tus propios retratos familiares con IA" . Phoronix.com . Consultado el 3 de octubre de 2019 .
- ↑ "¿Buscando la versión de PyTorch? - Stylegan2" . github.com . 28 de octubre de 2021. Consultado el 5 de agosto de 2022 .
- 1 2 "Síntesis de imágenes de alta resolución con StyleGAN2 – Centro de noticias para desarrolladores de NVIDIA" . news.developer.nvidia.com . 17 de junio de 2020. Consultado el 11 de agosto de 2020 .
- 1 2 NVlabs/stylegan2 , Proyectos de investigación de NVIDIA, 11 de agosto de 2020 , consultado el 11 de agosto de 2020
- ↑ Kakkar, Shobha (13 de octubre de 2021). "NVIDIA AI lanza StyleGAN3: Redes generativas adversarias sin alias" . MarkTechPost . Consultado el 14 de octubre de 2021 .
- 1 2 3 Karras, Tero; Aila, Timo; Laine, Samuli; Lehtinen, Jaakko (2018). "Crecimiento progresivo de GAN para mejorar la calidad, la estabilidad y la variación" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1710.10196 .
- ↑ msmash, n/a (14 de febrero de 2019) .El sitio web 'This Person Does Not Exist' utiliza IA para crear rostros realistas pero aterradores . Slashdot . Consultado el 16 de febrero de 2019 .
- 1 2 Fleishman, Glenn (30 de abril de 2019). "Cómo detectar a las personas falsas realistas que se infiltran en tus cronologías" . Fast Company . Recuperado el 7 de junio de 2020 .
- ↑ Bishop, Katie (7 de febrero de 2020). "IA en la industria para adultos: el porno pronto podría incluir personas que no existen" . The Guardian . Consultado el 8 de junio de 2020 .
- ↑ Porter, Jon (20 de septiembre de 2019). "100.000 retratos generados por IA gratuitos ponen en alerta a las empresas de fotografía de archivo" . The Verge . Consultado el 4 de agosto de 2020 .
- ↑ Timmins, Jane Wakefield y Beth (29 de febrero de 2020). "¿Podrían usarse los deepfakes para capacitar a los trabajadores de oficina?" . BBC News . Consultado el 4 de agosto de 2020 .
- ↑ Vincent, James (3 de marzo de 2019). "¿Puedes distinguir entre un rostro real y uno generado por IA?" . The Verge . Consultado el 8 de junio de 2020 .
- ↑ NVlabs/stylegan3 , Proyectos de investigación de NVIDIA, 11 de octubre de 2021
- ↑ "La última medida de Facebook tiene un giro inesperado: fotos de perfil generadas por IA" . ABC News . Consultado el 4 de agosto de 2020 .
- ↑ Karras, Tero; Laine, Samuli; Aila, Timo (2019). "Una arquitectura de generador basada en estilos para redes generativas adversarias" (PDF) . Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 4396–4405 . arXiv : 1812.04948 . doi : 10.1109/CVPR.2019.00453 . ISBN 978-1-7281-3293-8. S2CID 54482423 .
- ↑ Karras, Tero; Laine, Samuli; Aittala, Miika; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo (2020). "Análisis y mejora de la calidad de imagen de StyleGAN" (PDF) . Conferencia IEEE/CVF 2020 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 8107–8116 . arXiv : 1912.04958 . doi : 10.1109/CVPR42600.2020.00813 . ISBN 978-1-7281-7168-5. S2CID 209202273 .
- ^ Tero, Karras; Miika, Aittala; Janne, Hellsten; Samuli, Laine; Jaakko, Lehtinen; Timo, Aila (2020). "Capacitación de redes generativas adversarias con datos limitados" . Avances en los sistemas de procesamiento de información neuronal . 33 .
- ↑ Karras, Tero; Aittala, Miika; Laine, Samuli; Härkönen, Erik; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo (2021). Redes adversarias generativas sin alias (PDF) . Avances en los sistemas de procesamiento de información neuronal .
- ↑ Karras, Tero; Aittala, Miika; Laine, Samuli; Härkönen, Erik; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo. "Redes adversarias generativas sin alias (StyleGAN3)" . nvlabs.github.io . Consultado el 16 de julio de 2022 .
Enlaces externos
- El artículo original de Nvidia StyleGAN de 2018, titulado "Una arquitectura de generador basada en estilos para redes generativas adversarias", se encuentra en arXiv.org.
- Código de StyleGAN en GitHub.com
- Esta persona no existe.
- Fotos generadas
- Establecimientos de 2018
- Aplicaciones de software de aprendizaje profundo
- Gráficos por computadora
- Realidad virtual
- Aplicaciones de la visión por computadora