Articulo de referencia

Difusión estable

a photograph of an astronaut riding a horse "},"author":{"wt":"[[Runway (company)]], CompVis, and Stability AI"},"developer":{"wt":"[[Stability AI]]"},"released":{"wt":"August 2...

Stable Diffusion es un modelo de aprendizaje profundo para la conversión de texto a imagen , lanzado en 2022 y basado en técnicas de difusión . Esta tecnología de inteligencia artificial generativa es el producto estrella de Stability AI y se considera parte del auge actual de la IA .

Se utiliza principalmente para generar imágenes detalladas a partir de descripciones de texto, aunque también puede aplicarse a otras tareas como relleno de imágenes , relleno de imágenes y generación de traducciones de imágenes guiadas por una indicación de texto . [ 3 ] Su desarrollo involucró a investigadores del Grupo CompVis de la LMU de Múnich y Runway , con una donación computacional de Stability y datos de entrenamiento de organizaciones sin fines de lucro. [ 4 ] [ 5 ] [ 6 ] [ 7 ]

Stable Diffusion es un modelo de difusión latente , un tipo de red neuronal artificial generativa profunda . Su código y los pesos del modelo se han publicado públicamente , [ 8 ] y una versión optimizada puede ejecutarse en la mayoría del hardware de consumo equipado con una GPU modesta con tan solo 2,4  GB de VRAM . [ 9 ] Esto marcó un cambio con respecto a los modelos propietarios anteriores de conversión de texto a imagen, como DALL-E y Midjourney, que solo eran accesibles a través de servicios en la nube . [ 10 ] [ 11 ]

Desarrollo

Stable Diffusion se originó a partir de un proyecto llamado Latent Diffusion , [ 12 ] desarrollado en Alemania por investigadores de la LMU Munich en Múnich y la Universidad de Heidelberg . Cuatro de los cinco autores originales (Robin Rombach, Andreas Blattmann, Patrick Esser y Dominik Lorenz) se unieron posteriormente a Stability AI y publicaron versiones posteriores de Stable Diffusion. [ 13 ]

La licencia técnica del modelo fue publicada por el grupo CompVis de la LMU de Múnich. [ 11 ] El desarrollo fue liderado por Patrick Esser de Runway y Robin Rombach de CompVis, quienes se encontraban entre los investigadores que habían inventado previamente la arquitectura del modelo de difusión latente utilizada por Stable Diffusion. [ 7 ] Stability AI también reconoció a EleutherAI y LAION (una organización alemana sin fines de lucro que recopiló el conjunto de datos con el que se entrenó Stable Diffusion) como patrocinadores del proyecto. [ 7 ]

Tecnología

Diagrama de la arquitectura de difusión latente utilizada por Stable Diffusion.
El proceso de eliminación de ruido utilizado por Stable Diffusion. El modelo genera imágenes eliminando iterativamente el ruido aleatorio hasta alcanzar un número configurado de pasos, guiado por el codificador de texto CLIP preentrenado en conceptos junto con el mecanismo de atención, lo que da como resultado la imagen deseada que representa el concepto entrenado.

Arquitectura

Los modelos de difusión , introducidos en 2015, se entrenan con el objetivo de eliminar aplicaciones sucesivas de ruido gaussiano en imágenes de entrenamiento, lo que puede considerarse como una secuencia de autoencoders de eliminación de ruido . El nombre difusión proviene de la difusión termodinámica , ya que se desarrollaron inicialmente inspirándose en la termodinámica. [ 14 ] [ 15 ]

Los modelos de la serie Stable Diffusion anteriores a SD 3 utilizaban una variante de los modelos de difusión, denominada modelo de difusión latente (LDM) , desarrollada en 2021 por el grupo CompVis (Computer Vision & Learning) [ 16 ] de la LMU Munich . [ 17 ] [ 8 ]

La difusión estable consta de 3 partes: el autoencoder variacional (VAE), U-Net y un codificador de texto opcional. [ 18 ] El codificador VAE comprime la imagen del espacio de píxeles a un espacio latente de menor dimensión , capturando un significado semántico más fundamental de la imagen. [ 17 ] Se aplica ruido gaussiano iterativamente a la representación latente comprimida durante la difusión hacia adelante. [ 18 ] El bloque U-Net, compuesto por una red base ResNet , elimina el ruido de la salida de la difusión hacia adelante para obtener una representación latente. Finalmente, el decodificador VAE genera la imagen final convirtiendo la representación de nuevo al espacio de píxeles. [ 18 ]

El paso de eliminación de ruido puede condicionarse de forma flexible a una cadena de texto, una imagen u otra modalidad. Los datos de condicionamiento codificados se exponen a las U-Nets de eliminación de ruido mediante un mecanismo de atención cruzada . [ 18 ] Para el condicionamiento en texto, se utiliza el codificador de texto CLIP ViT-L/14 fijo y preentrenado para transformar las indicaciones de texto a un espacio de incrustación. [ 8 ] Los investigadores señalan una mayor eficiencia computacional para el entrenamiento y la generación como una ventaja de los LDM. [ 7 ] [ 17 ]

Con 860  millones de parámetros en la U-Net y 123  millones en el codificador de texto, Stable Diffusion se considera relativamente ligero según los estándares de 2022 y, a diferencia de otros modelos de difusión, puede ejecutarse en GPU de consumo , [ 19 ] e incluso solo en CPU si se utiliza la versión OpenVINO de Stable Diffusion. [ 20 ]

SD XL

La versión XL utiliza la misma arquitectura LDM que las versiones anteriores, [ 21 ] excepto que es más grande: una red troncal UNet más grande, un contexto de atención cruzada más grande, dos codificadores de texto en lugar de uno y entrenada en múltiples relaciones de aspecto (no solo la relación de aspecto cuadrada como las versiones anteriores).

El SD ​​XL Refiner, lanzado al mismo tiempo, tiene la misma arquitectura que el SD XL, pero fue entrenado para agregar detalles finos a imágenes preexistentes mediante la conversión de imágenes a imágenes (img2img) condicional por texto.

SD 3.0

La versión 3.0 [ 22 ] cambia completamente la estructura principal. No es una UNet, sino un transformador de flujo rectificado , que implementa el método de flujo rectificado [ 23 ] [ 24 ] con un transformador .

La arquitectura Transformer utilizada en SD 3.0 tiene tres "pistas": una para la codificación del texto original, otra para la codificación del texto transformado y otra para la codificación de imágenes (en el espacio latente). La codificación del texto transformado y la de las imágenes se combinan durante cada bloque Transformer.

La arquitectura se denomina "transformador de difusión multimodal (MMDiT)", donde "multimodal" significa que combina codificaciones de texto e imagen en sus operaciones. Esto difiere de las versiones anteriores de DiT, donde la codificación de texto afectaba a la de imagen, pero no al revés.

datos de entrenamiento

Stable Diffusion se entrenó en pares de imágenes y subtítulos tomados de LAION-5B, un conjunto de datos disponible públicamente derivado de datos de Common Crawl extraídos de la web, donde 5 mil millones de pares de imagen-texto se clasificaron según el idioma y se filtraron en conjuntos de datos separados por resolución, una probabilidad predicha de contener una marca de agua y una puntuación "estética" predicha (por ejemplo, calidad visual subjetiva). [ 25 ] El conjunto de datos fue creado por LAION , una organización alemana sin fines de lucro que recibe financiación de Stability AI. [ 25 ] [ 26 ] El modelo Stable Diffusion se entrenó en tres subconjuntos de LAION-5B: laion2B-en, laion-high-resolution y laion-aesthetics v2 5+. [ 25 ] Un análisis de terceros de los datos de entrenamiento del modelo identificó que, de un subconjunto más pequeño de 12  millones de imágenes tomadas del conjunto de datos original más amplio utilizado, aproximadamente el 47 % del tamaño de la muestra de imágenes provenía de 100 dominios diferentes, con Pinterest ocupando el 8,5 % del subconjunto, seguido de sitios web como WordPress , Blogspot , Flickr , DeviantArt y Wikimedia Commons . Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles. [ 27 ]

Procedimientos de capacitación

El modelo se entrenó inicialmente en los subconjuntos laion2B-en y laion-high-resolution, y las últimas rondas de entrenamiento se realizaron en LAION-Aesthetics v2 5+, un subconjunto de 600  millones de imágenes con subtítulos que el LAION-Aesthetics Predictor V2 predijo que los humanos, en promedio, darían una puntuación de al menos 5 sobre 10 cuando se les pidió que calificaran cuánto les gustaban. [ 28 ] [ 25 ] [ 29 ] El subconjunto LAION-Aesthetics v2 5+ también excluyó las imágenes de baja resolución y las imágenes que LAION-5B-WatermarkDetection identificó como portadoras de una marca de agua con una probabilidad superior al 80 %. [ 25 ] Las rondas finales de entrenamiento eliminaron adicionalmente el 10 % del condicionamiento de texto para mejorar la Guía de Difusión Sin Clasificador. [ 30 ]

El modelo se entrenó utilizando 256 GPU Nvidia A100 en Amazon Web Services durante un total de 150.000 horas de GPU, a un coste de 600.000 dólares. [ 31 ] [ 32 ] [ 33 ]

Limitaciones

Stable Diffusion tiene problemas de degradación e imprecisiones en ciertos escenarios. Las versiones iniciales del modelo se entrenaron en un conjunto de datos que consta de imágenes con una resolución de 512×512, lo que significa que la calidad de las imágenes generadas se degrada notablemente cuando las especificaciones del usuario se desvían de su resolución "esperada" de 512×512; [ 34 ] la actualización de la versión 2.0 del modelo Stable Diffusion introdujo posteriormente la capacidad de generar imágenes de forma nativa con una resolución de 768×768. [ 35 ] Otro desafío es la generación de extremidades humanas debido a la mala calidad de los datos de extremidades en la base de datos LAION. [ 36 ] El modelo no está suficientemente entrenado para replicar extremidades y rostros humanos debido a la falta de características representativas en la base de datos, y solicitar al modelo que genere imágenes de ese tipo puede confundir al modelo. [ 37 ] Además de las extremidades humanas, Stable Diffusion no puede generar ambigramas legibles y algunas otras formas de texto y tipografía. La versión 1.0 de Stable Diffusion XL (SDXL), lanzada en julio de 2023, introdujo una resolución nativa de 1024x1024 y mejoró la generación de extremidades y texto. [ 38 ] [ 39 ]

La accesibilidad para desarrolladores individuales también puede ser un problema. Para personalizar el modelo para nuevos casos de uso que no están incluidos en el conjunto de datos, como la generación de personajes de anime ("waifu diffusion"), [ 40 ] se requieren nuevos datos y entrenamiento adicional. Las adaptaciones ajustadas de Stable Diffusion creadas a través de un reentrenamiento adicional se han utilizado para una variedad de casos de uso diferentes, desde imágenes médicas [ 41 ] hasta música generada algorítmicamente . [ 42 ] Sin embargo, este proceso de ajuste fino es sensible a la calidad de los nuevos datos; las imágenes de baja resolución o resoluciones diferentes a las de los datos originales pueden no solo no aprender la nueva tarea, sino también degradar el rendimiento general del modelo. Incluso cuando el modelo se entrena adicionalmente con imágenes de alta calidad, es difícil para las personas ejecutar modelos en electrónica de consumo. Por ejemplo, el proceso de entrenamiento para la difusión de waifus requiere un mínimo de 30  GB de VRAM , [ 43 ] lo que excede el recurso habitual proporcionado en tales GPU de consumo como la serie GeForce 30 de Nvidia , que tiene solo unos 12 GB. [ 44 ] 

Los creadores de Stable Diffusion reconocen el potencial de sesgo algorítmico , ya que el modelo se entrenó principalmente con imágenes con descripciones en inglés. [ 32 ] Como resultado, las imágenes generadas refuerzan los sesgos sociales y provienen de una perspectiva occidental, dado que los creadores señalan que el modelo carece de datos de otras comunidades y culturas. El modelo ofrece resultados más precisos para las indicaciones escritas en inglés en comparación con las escritas en otros idiomas, siendo las culturas occidentales o blancas la representación predeterminada. [ 32 ]

Ajuste fino por parte del usuario final

Para abordar las limitaciones del entrenamiento inicial del modelo, los usuarios finales pueden optar por implementar un entrenamiento adicional para ajustar los resultados de la generación y adaptarlos a casos de uso más específicos, un proceso también conocido como personalización . Existen tres métodos mediante los cuales se puede aplicar un ajuste fino accesible al usuario a un punto de control del modelo de difusión estable:

  • Un "embedding" se puede entrenar a partir de una colección de imágenes proporcionadas por el usuario y permite que el modelo genere imágenes visualmente similares cuando se utiliza el nombre del embedding en una solicitud de generación. [ 45 ] Los embeddings se basan en el concepto de "inversión textual" desarrollado por investigadores de la Universidad de Tel Aviv en 2022 con el apoyo de Nvidia , donde las representaciones vectoriales de tokens específicos utilizados por el codificador de texto del modelo se vinculan a nuevas pseudopalabras. Los embeddings se pueden utilizar para reducir sesgos dentro del modelo original o imitar estilos visuales. [ 46 ]
  • Una "hiperred" es una pequeña red neuronal preentrenada que se aplica a varios puntos dentro de una red neuronal más grande, y se refiere a la técnica creada por el desarrollador de NovelAI, Kurumuz, en 2021, originalmente destinada a modelos transformadores de generación de texto . Las hiperredes dirigen los resultados hacia una dirección particular, lo que permite que los modelos basados ​​en difusión estable imiten el estilo artístico de artistas específicos, incluso si el artista no es reconocido por el modelo original; procesan la imagen encontrando áreas clave de importancia, como el cabello y los ojos, y luego parchean estas áreas en el espacio latente secundario. [ 47 ]
  • DreamBooth es un modelo de generación de aprendizaje profundo desarrollado por investigadores de Google Research y la Universidad de Boston en 2022 que puede ajustar el modelo para generar resultados precisos y personalizados que representan un sujeto específico, después de entrenarlo mediante un conjunto de imágenes que representan al sujeto. [ 48 ]

Capacidades

El modelo de difusión estable admite la capacidad de generar nuevas imágenes desde cero mediante el uso de una indicación de texto que describe los elementos que se incluirán u omitirán en la salida. [ 8 ] Las imágenes existentes pueden ser redibujadas por el modelo para incorporar nuevos elementos descritos por una indicación de texto (un proceso conocido como "síntesis de imágenes guiada" [ 49 ] ) a través de su mecanismo de difusión y eliminación de ruido. [ 8 ] Además, el modelo también permite el uso de indicaciones para alterar parcialmente las imágenes existentes mediante relleno y eliminación de relleno, cuando se utiliza con una interfaz de usuario apropiada que admita dichas funciones, de las cuales existen numerosas implementaciones de código abierto diferentes. [ 50 ]

Se recomienda ejecutar Stable Diffusion con 10  GB o más de VRAM; sin embargo, los usuarios con menos VRAM pueden optar por cargar los pesos con precisión float16 en lugar de la predeterminada float32 para equilibrar el rendimiento del modelo con un menor uso de VRAM. [ 34 ]

Generación de texto a imagen

Demostración del efecto de las indicaciones negativas en la generación de imágenes.
  • Arriba : sin sugerencia negativa
  • Centro : "árboles verdes"
  • Abajo : "piedras redondas, rocas redondas"

El script de muestreo de texto a imagen dentro de Stable Diffusion, conocido como "txt2img", consume una solicitud de texto además de varios parámetros de opción que cubren tipos de muestreo, dimensiones de la imagen de salida y valores de semilla. El script genera un archivo de imagen basado en la interpretación del modelo de la solicitud. [ 8 ] Las imágenes generadas se etiquetan con una marca de agua digital invisible para permitir a los usuarios identificar una imagen como generada por Stable Diffusion, [ 8 ] aunque esta marca de agua pierde su eficacia si la imagen se redimensiona o rota. [ 51 ]

Cada generación de txt2img implicará un valor semilla específico que afecta la imagen de salida. Los usuarios pueden optar por aleatorizar la semilla para explorar diferentes salidas generadas, o usar la misma semilla para obtener la misma imagen de salida que una imagen generada previamente. [ 34 ] Los usuarios también pueden ajustar el número de pasos de inferencia para el muestreador; un valor más alto requiere más tiempo, pero un valor más bajo puede resultar en defectos visuales. [ 34 ] Otra opción configurable, el valor de escala de guía sin clasificador, permite al usuario ajustar qué tan cerca se ajusta la imagen de salida a la indicación. [ 30 ] Los casos de uso más experimentales pueden optar por un valor de escala más bajo, mientras que los casos de uso que buscan salidas más específicas pueden usar un valor más alto. [ 34 ]

Las implementaciones de interfaz de usuario de Stable Diffusion proporcionan funciones adicionales de text2img , que permiten a los usuarios modificar el peso asignado a partes específicas del texto de la solicitud. Los marcadores de énfasis permiten a los usuarios añadir o reducir el énfasis a las palabras clave encerrándolas entre corchetes. [ 52 ] Un método alternativo para ajustar el peso a partes de la solicitud son las "indicaciones negativas". Las indicaciones negativas son una función incluida en algunas implementaciones de interfaz de usuario, incluido el servicio en la nube DreamStudio de Stability AI, y permiten al usuario especificar las indicaciones que el modelo debe evitar durante la generación de imágenes. Las indicaciones especificadas pueden ser características de imagen indeseables que de otro modo estarían presentes en las imágenes de salida debido a las indicaciones positivas proporcionadas por el usuario, o debido a cómo se entrenó originalmente el modelo, siendo las manos humanas mutiladas un ejemplo común. [ 50 ] [ 53 ]

Modificación de imagen

Demostración de la modificación img2img
  • Izquierda : Imagen original creada con Stable Diffusion 1.5
  • Derecha : Imagen modificada creada con Stable Diffusion XL 1.0

Stable Diffusion también incluye otro script de muestreo, "img2img", que toma como entrada un texto, la ruta a una imagen existente y un valor de intensidad entre 0,0 y 1,0. El script genera una nueva imagen basada en la original, que también incorpora los elementos proporcionados en el texto. El valor de intensidad indica la cantidad de ruido añadido a la imagen de salida. Un valor de intensidad mayor produce más variación en la imagen, pero puede generar una imagen que no sea semánticamente coherente con la entrada proporcionada. [ 8 ]

Hay diferentes métodos para realizar img2img. El método principal es SDEdit, [ 54 ] que primero agrega ruido a una imagen y luego lo elimina como es habitual en text2img.

La capacidad de img2img para agregar ruido a la imagen original la hace potencialmente útil para la anonimización y el aumento de datos , en los que las características visuales de los datos de imagen se modifican y anonimizan. [ 55 ] El mismo proceso también puede ser útil para el escalado de imágenes, en el que se aumenta la resolución de una imagen, con la posibilidad de agregar más detalles a la misma. [ 55 ] Además, se ha experimentado con la Difusión Estable como herramienta para la compresión de imágenes. En comparación con JPEG y WebP , los métodos recientes utilizados para la compresión de imágenes en Difusión Estable presentan limitaciones para preservar texto pequeño y rostros. [ 56 ]

Numerosas implementaciones de interfaz del modelo Stable Diffusion ofrecen casos de uso adicionales para la modificación de imágenes mediante img2img. El relleno de imágenes implica la modificación selectiva de una porción de una imagen existente delimitada por una máscara de capa proporcionada por el usuario , que rellena el espacio enmascarado con contenido generado a partir de la solicitud proporcionada. [ 50 ] Stability AI creó un modelo dedicado específicamente ajustado para casos de uso de relleno de imágenes junto con el lanzamiento de Stable Diffusion 2.0. [ 35 ] Por el contrario, el relleno de imágenes extiende una imagen más allá de sus dimensiones originales, rellenando el espacio previamente vacío con contenido generado a partir de la solicitud proporcionada. [ 50 ]

El 24 de noviembre de 2022 se introdujo un modelo guiado por profundidad, denominado "depth2img", con el lanzamiento de Stable Diffusion 2.0; este modelo infiere la profundidad de la imagen de entrada proporcionada y genera una nueva imagen de salida basada tanto en la indicación de texto como en la información de profundidad, lo que permite mantener la coherencia y la profundidad de la imagen de entrada original en la salida generada. [ 35 ]

Red de control

ControlNet [ 57 ] es una arquitectura de red neuronal diseñada para gestionar modelos de difusión mediante la incorporación de condiciones adicionales. Duplica los pesos de los bloques de la red neuronal en una copia "bloqueada" y una copia "entrenable". La copia "entrenable" aprende la condición deseada, mientras que la copia "bloqueada" conserva el modelo original. Este enfoque garantiza que el entrenamiento con pequeños conjuntos de datos de pares de imágenes no comprometa la integridad de los modelos de difusión listos para producción. La "convolución cero" es una convolución de 1×1 con pesos y sesgos inicializados a cero. Antes del entrenamiento, todas las convoluciones cero producen una salida cero, evitando cualquier distorsión causada por ControlNet. Ninguna capa se entrena desde cero; el proceso aún se encuentra en fase de ajuste fino, manteniendo seguro el modelo original. Este método permite el entrenamiento en dispositivos de pequeña escala o incluso personales.

ControlNet se utiliza habitualmente para modificar la generación de una imagen a partir de una imagen de entrada que mapea las propiedades deseadas en la imagen final. Los tipos de imágenes de mapeo más comunes incluyen mapas de profundidad , bordes o una o más poses esqueléticas . Estas entradas pueden generarse directamente, pero a menudo se derivan de otras imágenes mediante redes neuronales o procesos como la detección de bordes .

Interfaces de usuario

Stability proporciona un servicio de generación de imágenes en línea llamado DreamStudio . [ 58 ] [ 59 ] La empresa también lanzó una versión de código abierto de DreamStudio llamada StableStudio . [ 60 ] [ 61 ] Además de las interfaces de Stability, existen muchas interfaces de código abierto de terceros, como AUTOMATIC1111 Stable Diffusion Web UI , que es la más popular y ofrece funciones adicionales, [ 62 ] Fooocus , que tiene como objetivo disminuir la cantidad de indicaciones que necesita el usuario, [ 63 ] y ComfyUI , que tiene una interfaz de usuario basada en nodos , esencialmente un lenguaje de programación visual similar a muchas aplicaciones de modelado 3D . [ 64 ] [ 65 ] [ 66 ]

Lanzamientos

Documentos clave

  • Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural (2021). [ 79 ] Este artículo describe el método CLIP para entrenar codificadores de texto, que convierten texto en vectores de punto flotante. El modelo de difusión utiliza estas codificaciones de texto para crear imágenes.
  • SDEdit: Síntesis y edición de imágenes guiadas con ecuaciones diferenciales estocásticas (2021). [ 54 ] Este artículo describe SDEdit, también conocido como "img2img".
  • Síntesis de imágenes de alta resolución con modelos de difusión latente (2021, actualizado en 2022). [ 80 ] Este artículo describe el modelo de difusión latente (LDM). Este es el núcleo de la arquitectura de difusión estable.
  • Guía de difusión sin clasificador (2022). [ 30 ] Este artículo describe CFG, que permite que el vector de codificación de texto dirija el modelo de difusión hacia la creación de la imagen descrita por el texto.
  • SDXL: Mejora de los modelos de difusión latente para la síntesis de imágenes de alta resolución (2023). [ 21 ] Describe SDXL.
  • Flujo directo y rápido: aprender a generar y transferir datos con flujo rectificado (2022). [ 23 ] [ 24 ] Describe el flujo rectificado, que se utiliza para la arquitectura de la columna vertebral de SD 3.0.
  • Escalado de transformadores de flujo rectificados para síntesis de imágenes de alta resolución (2024). [ 22 ] Describe SD 3.0.

Costo de capacitación

  • SD 2.0: 0,2 millones de horas en A100 (40 GB). [ 71 ]

Stable Diffusion 3.5 Large se puso a disposición para uso empresarial en Amazon Bedrock de Amazon Web Services . [ 81 ]

Uso y controversia

Stable Diffusion no reclama ningún derecho sobre las imágenes generadas y otorga libremente a los usuarios los derechos de uso de cualquier imagen generada por el modelo, siempre que el contenido de la imagen no sea ilegal ni perjudicial para las personas. [ 82 ]

Las imágenes con las que se entrenó Stable Diffusion se filtraron sin intervención humana, lo que provocó que aparecieran algunas imágenes dañinas y grandes cantidades de información privada y sensible en los datos de entrenamiento. [ 27 ]

Los artistas visuales más tradicionales han expresado su preocupación de que el uso generalizado de software de síntesis de imágenes como Stable Diffusion pueda eventualmente llevar a que los artistas humanos, junto con fotógrafos, modelos, cineastas y actores, pierdan gradualmente viabilidad comercial frente a competidores basados ​​en IA. [ 83 ]

Stable Diffusion es notablemente más permisivo en los tipos de contenido que los usuarios pueden generar, como imágenes violentas o sexualmente explícitas, en comparación con otros productos comerciales basados ​​en IA generativa. [ 84 ] Abordando las preocupaciones de que el modelo pueda usarse para fines abusivos, el CEO de Stability AI, Emad Mostaque , argumenta que "[es] responsabilidad de las personas si son éticas, morales y legales en cómo operan esta tecnología", [ 11 ] y que poner las capacidades de Stable Diffusion en manos del público resultaría en que la tecnología proporcionara un beneficio neto, a pesar de las posibles consecuencias negativas. [ 11 ] Además, Mostaque argumenta que la intención detrás de la disponibilidad abierta de Stable Diffusion es terminar con el control y dominio corporativo sobre tales tecnologías, que anteriormente solo han desarrollado sistemas de IA cerrados para síntesis de imágenes. [ 11 ] [ 84 ] Esto se refleja en el hecho de que cualquier restricción que Stability AI imponga al contenido que los usuarios puedan generar puede eludirse fácilmente debido a la disponibilidad del código fuente. [ 85 ]

Se ha planteado la controversia en torno a las representaciones sexualizadas fotorrealistas de personajes menores de edad , debido a que dichas imágenes generadas por Stable Diffusion se comparten en sitios web como Pixiv . [ 86 ]

En junio de 2024, se produjo un ataque informático a una extensión de ComfyUI , una interfaz de usuario para Stable Diffusion, en el que los hackers afirmaron haber atacado a usuarios que habían cometido "uno de nuestros pecados", que incluían la generación de arte mediante IA, el robo de arte y la promoción de criptomonedas . [ 87 ]

Litigio

Andersen, McKernan y Ortiz contra Stability AI, Midjourney y DeviantArt.

En enero de 2023, tres artistas, Sarah Andersen , Kelly McKernan y Karla Ortiz, presentaron una demanda por infracción de derechos de autor contra Stability AI, Midjourney y DeviantArt , alegando que estas empresas habían infringido los derechos de millones de artistas al entrenar herramientas de IA con cinco mil millones de imágenes extraídas de la web sin el consentimiento de los artistas originales. [ 88 ]

En julio de 2023, el juez de distrito estadounidense William Orrick se inclinó a desestimar la mayor parte de la demanda presentada por Andersen, McKernan y Ortiz, pero les permitió presentar una nueva demanda, brindándoles la oportunidad de reformular sus argumentos. [ 89 ]

Getty Images contra IA de estabilidad

En enero de 2023, Getty Images inició un proceso legal contra Stability AI ante el Tribunal Superior de Inglaterra, alegando una infracción significativa de sus derechos de propiedad intelectual. Getty Images afirma que Stability AI extrajo millones de imágenes de los sitios web de Getty sin su consentimiento y las utilizó para entrenar y desarrollar su modelo de aprendizaje profundo Stable Diffusion. [ 90 ] [ 91 ]

Los puntos clave de la demanda incluyeron:

  • Getty Images afirmó que el entrenamiento y desarrollo de Stable Diffusion implicó el uso no autorizado de sus imágenes, las cuales fueron descargadas en servidores y computadoras que potencialmente se encontraban en el Reino Unido. Sin embargo, Stability AI argumentó que todo el entrenamiento y desarrollo se llevó a cabo fuera del Reino Unido, específicamente en centros de datos estadounidenses operados por Amazon Web Services. [ 92 ]
  • Stability AI solicitó la anulación del juicio sumario y/o la desestimación de dos demandas: la relativa a la formación y el desarrollo, y la relativa a la infracción secundaria de derechos de autor. Sin embargo, el Tribunal Superior se negó a desestimar estas demandas, permitiendo que procedieran a juicio. El tribunal debe determinar si la formación y el desarrollo de Stable Diffusion tuvieron lugar en el Reino Unido, lo cual es crucial para establecer la jurisdicción en virtud de la Ley de Derechos de Autor, Diseños y Patentes de 1988 (CDPA) del Reino Unido. [ 93 ]
  • La demanda secundaria por infracción giraba en torno a si el software preentrenado Stable Diffusion, disponible en el Reino Unido a través de plataformas como GitHub, HuggingFace y DreamStudio, constituye un "artículo" según las secciones 22 y 23 de la CDPA. [ 93 ]

A partir del 4 de noviembre de 2025, Getty Images perdió en gran medida la demanda sobre el generador de imágenes de IA contra Stability AI , lo que llevó a Getty y a algunos abogados a pedir mayores protecciones para los propietarios de derechos de autor en Gran Bretaña. [ 94 ]

Licencia

A diferencia de modelos como DALL-E , Stable Diffusion pone a disposición su código fuente , [ 95 ] [ 8 ] junto con el modelo (pesos preentrenados). Antes de Stable Diffusion 3, aplicaba la licencia Creative ML OpenRAIL-M, una forma de Licencia de IA Responsable (RAIL), al modelo (M). [ 96 ] La licencia prohíbe ciertos casos de uso, incluyendo delitos, difamación , acoso , doxing , " explotación de menores ", dar consejos médicos, crear automáticamente obligaciones legales, producir pruebas legales y "discriminar o dañar a individuos o grupos en función de... comportamiento social o... características personales o de personalidad... [o] características o categorías legalmente protegidas ". [ 97 ] [ 98 ] El usuario posee los derechos de las imágenes de salida generadas y es libre de usarlas comercialmente. [ 99 ]

Stable Diffusion 3.5 aplica la licencia permisiva Stability AI Community License, mientras que las empresas comerciales con ingresos superiores a 1 millón de dólares necesitan la licencia Stability AI Enterprise License. [ 100 ] Al igual que con la licencia OpenRAIL-M, el usuario conserva los derechos sobre las imágenes de salida generadas y puede utilizarlas comercialmente. [ 1 ]

Véase también

Referencias

  1. 1 2 3 "Difusión estable 3.5" . IA de estabilidad . Consultado el 23 de octubre de 2024 .{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  2. Ryan O'Connor (23 de agosto de 2022). "Cómo ejecutar Stable Diffusion localmente para generar imágenes" . Archivado del original el 13 de octubre de 2023. Consultado el 4 de mayo de 2023 .
  3. "Difunde el resto: un espacio de Hugging Face por huggingface" . huggingface.co . Archivado del original el 5 de septiembre de 2022. Consultado el 5 de septiembre de 2022 .
  4. "Una presentación filtrada genera dudas sobre la propuesta de Stability AI para la ronda de financiación Serie A" . sifted.eu . Archivado del original el 29 de junio de 2023. Consultado el 20 de junio de 2023 .
  5. " Revolucionando la generación de imágenes mediante IA: Transformando texto en imágenes" . www.lmu.de. Archivado del original el 17 de septiembre de 2022. Consultado el 21 de junio de 2023 .
  6. Mostaque, Emad (2 de noviembre de 2022). "Stable Diffusion surgió del grupo de investigación de Visión por Computadora y Aprendizaje (CompVis) @LMU_Muenchen" . Twitter . Archivado del original el 20 de julio de 2023. Recuperado el 22 de junio de 2023 .
  7. 1 2 3 4 "Anuncio de lanzamiento de difusión estable" . Stability.Ai . Archivado del original el 5 de septiembre de 2022. Recuperado el 6 de septiembre de 2022 .
  8. 1 2 3 4 5 6 7 8 9 "Repositorio de difusión estable en GitHub" . CompVis - Grupo de investigación en visión artificial y aprendizaje, LMU Múnich. 17 de septiembre de 2022. Archivado del original el 18 de enero de 2023. Recuperado el 17 de septiembre de 2022 .
  9. "basujindal/stable-diffusion" . GitHub . 16 de noviembre de 2022. Archivado del original el 20 de marzo de 2025. Consultado el 30 de marzo de 2025 .
  10. "La nueva aplicación estrella: Crear arte con IA pondrá a prueba tu PC por completo" . PCWorld . Archivado del original el 31 de agosto de 2022. Consultado el 31 de agosto de 2022 .
  11. 1 2 3 4 5 Vincent, James (15 de septiembre de 2022). "Cualquiera puede usar este generador de arte con IA: ese es el riesgo" . The Verge . Archivado del original el 21 de enero de 2023. Recuperado el 30 de septiembre de 2022 .
  12. "CompVis/Latent-diffusion" . GitHub .
  13. Rombach; Esser. "Escalado de transformadores de flujo rectificados para síntesis de imágenes de alta resolución" (PDF) .{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace )
  14. David, Foster. "8. Modelos de difusión". Aprendizaje profundo generativo (2.ª ed.). O'Reilly. 
  15. ^ Jascha Sohl-Dickstein, Eric A. Weiss, Niru Maheswaranathan, Surya Ganguli (12 de marzo de 2015). "Aprendizaje profundo no supervisado utilizando termodinámica de desequilibrio". arXiv : 1503.03585 [ cs.LG ].{{cite arXiv}}: CS1 maint: varios nombres: lista de autores ( enlace )
  16. "Inicio" . Computer Vision & Learning Group . Consultado el 5 de septiembre de 2024 .
  17. 1 2 3 Rombach; Blattmann; Lorenz; Esser; Ommer (junio de 2022). Síntesis de imágenes de alta resolución con modelos de difusión latente (PDF) . Conferencia internacional sobre visión por computadora y reconocimiento de patrones (CVPR). Nueva Orleans, LA. págs. 10684–10695 . arXiv : 2112.10752 . Archivado (PDF) del original el 20 de enero de 2023. Recuperado el 17 de septiembre de 2022 . 
  18. 1 2 3 4 Alammar, Jay. "La difusión estable ilustrada" . jalammar.github.io . Archivado del original el 1 de noviembre de 2022. Recuperado el 31 de octubre de 2022 .
  19. "Stable diffusion pipelines" . huggingface.co . Archivado del original el 25 de junio de 2023. Consultado el 22 de junio de 2023 .
  20. "Generación de texto a imagen con difusión estable y OpenVINO™" . openvino.ai . Intel . Consultado el 10 de febrero de 2024 .
  21. 1 2 3 Podell, Dustin; English, Zion; Lacey, Kyle; Blattmann, Andreas; Dockhorn, Tim; Müller, Jonas; Penna, Joe; Rombach, Robin (4 de julio de 2023). "SDXL: Mejora de los modelos de difusión latente para la síntesis de imágenes de alta resolución". arXiv : 2307.01952 [ cs.CV ].
  22. 1 2 3 Esser, Patrick; Kulal, Sumith; Blattmann, Andreas; Entezari, Rahim; Müller, Jonas; Saini, Harry; Levi, Yam; Lorenz, Dominik; Sauer, Axel (5 de marzo de 2024), Escalado de transformadores de flujo rectificados para síntesis de imágenes de alta resolución , arXiv : 2403.03206
  23. 1 2 Liu, Xingchao; Gong, Chengyue; Liu, Qiang (7 de septiembre de 2022), Flujo directo y rápido: aprendizaje para generar y transferir datos con flujo rectificado , arXiv : 2209.03003
  24. 1 2 "Flujo rectificado — Flujo rectificado" . www.cs.utexas.edu . Consultado el 6 de marzo de 2024 .
  25. 1 2 3 4 5 Baio, Andy (30 de agosto de 2022). "Explorando 12 millones de las 2.3 mil millones de imágenes utilizadas para entrenar el generador de imágenes de Stable Diffusion" . Waxy.org . Archivado del original el 20 de enero de 2023. Recuperado el 2 de noviembre de 2022 .
  26. "Este artista está dominando el arte generado por IA. Y no está contento con ello" . MIT Technology Review . Archivado del original el 14 de enero de 2023. Consultado el 2 de noviembre de 2022 .
  27. 1 2 Brunner, Katharina; Harlan, Elisa (7 de julio de 2023). "Todos somos materia prima para la IA" . Bayerischer Rundfunk (BR). Archivado del original el 12 de septiembre de 2023. Recuperado el 12 de septiembre de 2023 .
  28. Schuhmann, Christoph (2 de noviembre de 2022), CLIP+MLP Aesthetic Score Predictor , archivado del original el 8 de junio de 2023 , recuperado el 2 de noviembre de 2022.
  29. "LAION-Estética | LAION" . laion.ai . Archivado del original el 26 de agosto de 2022. Consultado el 2 de septiembre de 2022 .
  30. 1 2 3 Ho, Jonathan; Salimans, Tim (25 de julio de 2022). "Guía de difusión sin clasificadores". arXiv : 2207.12598 [ cs.LG ].
  31. Mostaque, Emad (28 de agosto de 2022). "Costo de construcción" . Twitter . Archivado del original el 6 de septiembre de 2022. Recuperado el 6 de septiembre de 2022 .
  32. 1 2 3 "CompVis/stable-diffusion-v1-4 · Hugging Face" . huggingface.co . Archivado del original el 11 de enero de 2023. Recuperado el 2 de noviembre de 2022 .
  33. Wiggers, Kyle (12 de agosto de 2022). "Una startup quiere democratizar la tecnología detrás de DALL-E 2, sin importar las consecuencias" . TechCrunch . Archivado del original el 19 de enero de 2023. Consultado el 2 de noviembre de 2022 .
  34. 1 2 3 4 5 "Difusión estable con difusores 🧨" . huggingface.co . Archivado del original el 17 de enero de 2023. Recuperado el 31 de octubre de 2022 .
  35. 1 2 3 "Stable Diffusion 2.0 Release" . stability.ai . Archivado del original el 10 de diciembre de 2022.
  36. "LAION" . laion.ai . Archivado del original el 16 de octubre de 2023. Consultado el 31 de octubre de 2022 .
  37. "Generación de imágenes con difusión estable" . Blog de Paperspace . 24 de agosto de 2022. Archivado del original el 31 de octubre de 2022. Consultado el 31 de octubre de 2022 .
  38. "Anuncio de SDXL 1.0" . IA de estabilidad . Archivado del original el 26 de julio de 2023. Consultado el 21 de agosto de 2023 .
  39. Edwards, Benj (27 de julio de 2023). "Stability AI lanza Stable Diffusion XL, su modelo de síntesis de imágenes de próxima generación" . Ars Technica . Archivado del original el 21 de agosto de 2023. Recuperado el 21 de agosto de 2023 .
  40. "hakurei/waifu-diffusion · Hugging Face" . huggingface.co . Archivado del original el 8 de octubre de 2023. Recuperado el 31 de octubre de 2022 .
  41. Chambon, Pierre; Bluethgen, Christian; Langlotz, Curtis P.; Chaudhari, Akshay (9 de octubre de 2022). "Adaptación de modelos fundamentales de visión-lenguaje preentrenados a dominios de imágenes médicas". arXiv : 2210.04133 [ cs.CV ].
  42. Seth Forsgren; Hayk Martiros. "Riffusion - Difusión estable para la generación de música en tiempo real" . Riffusion . Archivado del original el 16 de diciembre de 2022.
  43. Mercurio, Anthony (31 de octubre de 2022), Waifu Diffusion , archivado del original el 31 de octubre de 2022 , recuperado el 31 de octubre de 2022
  44. Smith, Ryan. "NVIDIA lanza discretamente la GeForce RTX 3080 de 12 GB: más VRAM, más potencia, más dinero" . www.anandtech.com . Archivado del original el 27 de agosto de 2023. Consultado el 31 de octubre de 2022 .
  45. Dave James (28 de octubre de 2022). "Exigí al máximo la RTX 4090 durante 8 horas seguidas entrenando la Difusión Estable para pintar como mi tío Hermann" . PC Gamer . Archivado del original el 9 de noviembre de 2022.
  46. Gal, Rinon; Alaluf, Yuval; Atzmon, Yuval; Patashnik, Or; Bermano, Amit H.; Chechik, Gal; Cohen-Or, Daniel (2 de agosto de 2022). "Una imagen vale más que una palabra: Personalización de la generación de texto a imagen mediante inversión textual". arXiv : 2208.01618 [ cs.CV ].
  47. ^ "Nuevas mejoras de IA en difusión estable" . Novela AI . 11 de octubre de 2022.{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  48. Yuki Yamashita (1 de septiembre de 2022). "愛犬の合成画像を生成できるAI 文章で指示するだけでコスプレ 米Googleが開発" . ITmedia Inc. (en japonés). Archivado desde el original el 31 de agosto de 2022.
  49. ^ Meng, Chenlin; Él, Yutong; Canción, Yang; Canción, Jiaming; Wu, Jiajun; Zhu, Jun-Yan; Ermon, Stefano (2 de agosto de 2021). "SDEdit: Síntesis y edición de imágenes guiadas con ecuaciones diferenciales estocásticas". arXiv : 2108.01073 [ cs.CV ].
  50. 1 2 3 4 "Interfaz web de difusión estable" . GitHub . 10 de noviembre de 2022. Archivado del original el 20 de enero de 2023. Recuperado el 27 de septiembre de 2022 .
  51. invisible-watermark , Shield Mountain, 2 de noviembre de 2022, archivado del original el 18 de octubre de 2022 , recuperado el 2 de noviembre de 2022
  52. "stable-diffusion-tools/emphasis en master · JohannesGaessler/stable-diffusion-tools" . GitHub . Archivado del original el 2 de octubre de 2022. Recuperado el 2 de noviembre de 2022 .
  53. "Actualizaciones de Stable Diffusion v2.1 y DreamStudio del 7 de diciembre de 2022" . stability.ai . Archivado del original el 10 de diciembre de 2022.
  54. 1 2 Meng, Chenlin; Él, Yutong; Canción, Yang; Canción, Jiaming; Wu, Jiajun; Zhu, Jun-Yan; Ermon, Stefano (4 de enero de 2022). "SDEdit: Síntesis y edición de imágenes guiadas con ecuaciones diferenciales estocásticas". arXiv : 2108.01073 [ cs.CV ].
  55. 1 2 Luzi, Lorenzo; Siahkoohi, Ali; Mayer, Paul M.; Casco-Rodríguez, Josue; Baraniuk, Richard (21 de octubre de 2022). "Boomerang: muestreo local en variedades de imágenes utilizando modelos de difusión". arXiv : 2210.12100 [ cs.CV ].
  56. Bühlmann, Matthias (28 de septiembre de 2022). "Compresión de imágenes estable basada en difusión" . Medium . Archivado del original el 2 de noviembre de 2022. Recuperado el 2 de noviembre de 2022 .
  57. Zhang, Lvmin (10 de febrero de 2023). "Añadiendo control condicional a los modelos de difusión de texto a imagen". arXiv : 2302.05543 [ cs.CV ].
  58. Edwards, Benj (10 de noviembre de 2022). "¿Difusión estable en tu bolsillo? "Draw Things" lleva las imágenes de IA al iPhone" . Ars Technica . Recuperado el 10 de julio de 2024 .
  59. Wendling, Mike (6 de marzo de 2024). "La IA se puede usar fácilmente para hacer fotos electorales falsas - informe" . bbc.com . Recuperado el 10 de julio de 2024. El CCDH, un grupo de campaña, probó cuatro de las plataformas de IA más grandes orientadas al público: Midjourney, ChatGPT Plus de OpenAI, DreamStudio de Stability.ai e Image Creator de Microsoft.
  60. Wiggers, Kyle (18 de mayo de 2023). "Stability AI publica el código fuente de su estudio de diseño impulsado por IA" . TechCrunch . Recuperado el 10 de julio de 2024 .
  61. Weatherbed, Jess (17 de mayo de 2023). "Stability AI está publicando como código abierto su aplicación web DreamStudio" . The Verge .
  62. Mann, Tobias (29 de junio de 2024). "Una guía amigable para la generación de imágenes de IA local con Stable Diffusion y Automatic1111" . The Register .
  63. Hachman, Mak. "Fooocus es la forma más fácil de crear arte con IA en tu PC" . PCWorld .
  64. "Flujos de trabajo de ComfyUI y lo que necesitas saber" . thinkdiffusion.com . Diciembre de 2023. Consultado el 10 de julio de 2024 .
  65. "ComfyUI" . github.com . Consultado el 10 de julio de 2024 .
  66. Huang, Yenkai (10 de mayo de 2024). Motor de composición autorrecursiva latente (tesis de maestría en Ciencias de la Computación). Dartmouth College . Recuperado el 10 de julio de 2024 .
  67. "CompVis/stable-diffusion-v1-4 · Hugging Face" . huggingface.co . Archivado del original el 11 de enero de 2023. Consultado el 17 de agosto de 2023 .
  68. "CompVis (CompVis)" . huggingface.co . 23 de agosto de 2023. Consultado el 6 de marzo de 2024 .
  69. 1 2 "runwayml/stable-diffusion-v1-5 · Hugging Face" . huggingface.co . Archivado del original el 21 de septiembre de 2023. Recuperado el 17 de agosto de 2023 .
  70. "stable-diffusion-v1-5/stable-diffusion-v1-5 · Hugging Face" . huggingface.co . Archivado del original el 26 de mayo de 2025. Consultado el 1 de junio de 2025 .
  71. 1 2 "stabilityai/stable-diffusion-2 · Hugging Face" . huggingface.co . Archivado del original el 21 de septiembre de 2023. Recuperado el 17 de agosto de 2023 .
  72. "stabilityai/stable-diffusion-2-base · Hugging Face" . huggingface.co . Consultado el 1 de enero de 2024 .
  73. "stabilityai/stable-diffusion-2-1 · Hugging Face" . huggingface.co . Archivado del original el 21 de septiembre de 2023. Consultado el 17 de agosto de 2023 .
  74. "stabilityai/stable-diffusion-xl-base-1.0 · Hugging Face" . huggingface.co . Archivado del original el 8 de octubre de 2023. Consultado el 17 de agosto de 2023 .
  75. "Anuncio de SDXL 1.0" . Stability AI . Consultado el 1 de enero de 2024 .
  76. "stabilityai/sdxl-turbo · Hugging Face" . huggingface.co . Consultado el 1 de enero de 2024 .
  77. "Destilación por difusión adversaria" . IA de estabilidad . Consultado el 1 de enero de 2024 .
  78. "Difusión estable 3" . IA de estabilidad . Consultado el 5 de marzo de 2024 .
  79. Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela (26 de febrero de 2021). "Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural". arXiv : 2103.00020 [ cs.CV ].
  80. Rombach, Robin; Blattmann, Andreas; Lorenz, Dominik; Esser, Patrick; Ommer, Björn (2022). "Síntesis de imágenes de alta resolución con modelos de difusión latente" . Actas de la Conferencia IEEE/CVF sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . págs. 10684–10695 . arXiv : 2112.10752 . 
  81. Kerner, Sean Michael (19 de diciembre de 2024). "Stable Diffusion 3.5 llega a Amazon Bedrock: ¿Qué significa para los flujos de trabajo de IA empresariales?" . VentureBeat . Consultado el 25 de diciembre de 2024 .
  82. "LICENSE.md · stabilityai/stable-diffusion-xl-base-1.0 en main" . huggingface.co . 26 de julio de 2023. Consultado el 1 de enero de 2024 .
  83. Heikkilä, Melissa (16 de septiembre de 2022). "Este artista está dominando el arte generado por IA. Y no está contento con ello" . MIT Technology Review . Archivado del original el 14 de enero de 2023. Recuperado el 26 de septiembre de 2022 .
  84. ^ Ryo Shimizu (26 de agosto de 2022). "Midjourney を超えた? 無料の作画AI「 #StableDiffusion 」が「AIを民主化した」と断言できる理由" . Business Insider Japón (en japonés). Archivado desde el original el 10 de diciembre de 2022 . Consultado el 4 de octubre de 2022 .
  85. Cai, Kenrick. "La startup detrás del generador de imágenes con IA Stable Diffusion está en conversaciones para recaudar fondos con una valoración de hasta 1.000 millones de dólares" . Forbes . Archivado del original el 30 de septiembre de 2023. Consultado el 31 de octubre de 2022 .
  86. "Se expone el comercio ilegal de imágenes de abuso sexual infantil mediante IA" . BBC News . 27 de junio de 2023. Archivado del original el 21 de septiembre de 2023. Consultado el 26 de septiembre de 2023 .
  87. Maiberg, Emanuel (11 de junio de 2024). "Los hackers atacan a usuarios de IA con una herramienta de difusión estable maliciosa en GitHub para protestar por el 'robo de arte'"." . 404 Media . Consultado el 14 de junio de 2024 .
  88. Vincent, James (16 de enero de 2023). "Las herramientas de arte con IA Stable Diffusion y Midjourney son objeto de una demanda por derechos de autor" . The Verge . Archivado del original el 9 de marzo de 2023. Consultado el 16 de enero de 2023 .
  89. Brittain, Blake (19 de julio de 2023). "Juez estadounidense encuentra fallas en la demanda de artistas contra empresas de IA" . Reuters . Archivado del original el 6 de septiembre de 2023. Recuperado el 6 de agosto de 2023 .
  90. Goosens, Sophia (28 de febrero de 2024). "Getty Images contra Stability AI: las implicaciones para la legislación y las licencias de derechos de autor en el Reino Unido" .
  91. Gill, Dennis (11 de diciembre de 2023). "Getty Images contra Stability AI: las demandas por derechos de autor pueden llegar a juicio" .
  92. Goosens, Sophia (28 de febrero de 2024). "El caso Getty contra Stability AI llega a juicio en el Reino Unido: lo que hemos aprendido" .
  93. 1 2 Hill, Charlotte (16 de febrero de 2024). "Inteligencia artificial generativa en los tribunales: Getty Images contra Stability AI" .
  94. Tobin, Sam (4 de noviembre de 2025). "Getty Images pierde en gran medida una demanda histórica en el Reino Unido sobre un generador de imágenes con IA" .
  95. "Lanzamiento público de difusión estable" . Stability.Ai . Archivado del original el 30 de agosto de 2022. Consultado el 31 de agosto de 2022 .
  96. "De RAIL a Open RAIL: Topologías de las licencias RAIL" . Licencias de IA Responsables (RAIL) . 18 de agosto de 2022. Archivado del original el 27 de julio de 2023. Consultado el 20 de febrero de 2023 .
  97. "Prepárense o no, los deepfakes de vídeo masivos están llegando" . The Washington Post . 30 de agosto de 2022. Archivado del original el 31 de agosto de 2022. Consultado el 31 de agosto de 2022 .
  98. "Licencia - un espacio de Hugging Face por CompVis" . huggingface.co . Archivado del original el 4 de septiembre de 2022. Recuperado el 5 de septiembre de 2022 .
  99. Katsuo Ishida (26 de agosto de 2022). "言葉で指示した画像を凄いAIが描き出す「Difusión estable」 ~画像は商用利用も可能" . Impress Corporation (en japonés). Archivado desde el original el 14 de noviembre de 2022 . Consultado el 4 de octubre de 2022 .
  100. "Licencia comunitaria" . Stability AI . 5 de julio de 2024. Consultado el 23 de octubre de 2024 .
  • Demostración de difusión estable
  • "Introducción visual paso a paso a los modelos de difusión. - Blog de Kemal Erdem" . Consultado el 31 de agosto de 2024 .
  • "U-Net para difusión estable" . U-Net para difusión estable . Consultado el 31 de agosto de 2024 .
  • Explicación interactiva de la difusión estable
  • "Todos somos materia prima para la IA" : Investigación sobre datos sensibles y privados en los datos de entrenamiento de Stable Diffusions
Obtenido de " https://en.wikipedia.org/w/index.php?title=Stable_Diffusion&oldid=1357956357 "