En aprendizaje automático , los modelos de difusión , también conocidos como modelos generativos basados en difusión o modelos generativos basados en puntuación , son una clase de modelos generativos de variables latentes . Un modelo de difusión consta de dos componentes principales: el proceso de difusión hacia adelante y el proceso de muestreo inverso. El objetivo de los modelos de difusión es aprender un proceso de difusión para un conjunto de datos dado, de manera que el proceso pueda generar nuevos elementos que se distribuyan de forma similar al conjunto de datos original. Un modelo de difusión modela los datos como generados por un proceso de difusión, donde un nuevo dato realiza un paseo aleatorio con deriva a través del espacio de todos los datos posibles. [ 1 ] Un modelo de difusión entrenado puede muestrearse de muchas maneras, con diferente eficiencia y calidad.
Existen varios formalismos equivalentes, incluyendo cadenas de Markov , modelos probabilísticos de difusión de eliminación de ruido, redes de puntuación condicionadas al ruido y ecuaciones diferenciales estocásticas. [ 2 ] Suelen entrenarse mediante inferencia variacional . [ 3 ] El modelo responsable de la eliminación de ruido se denomina normalmente su " columna vertebral ". La columna vertebral puede ser de cualquier tipo, pero suelen ser U-nets o transformadores .
A partir de 2024Los modelos de difusión se utilizan principalmente para tareas de visión artificial , incluyendo la eliminación de ruido en imágenes , el relleno de imágenes , la superresolución , la generación de imágenes y la generación de vídeo. Estas tareas suelen implicar el entrenamiento de una red neuronal para eliminar secuencialmente el ruido de imágenes borrosas con ruido gaussiano . [ 1 ] [ 4 ] El modelo se entrena para revertir el proceso de añadir ruido a una imagen. Tras el entrenamiento hasta la convergencia, se puede utilizar para la generación de imágenes partiendo de una imagen compuesta de ruido aleatorio y aplicando la red iterativamente para eliminar el ruido de la imagen.
Los generadores de imágenes basados en difusión han despertado un gran interés comercial, como Stable Diffusion y DALL-E . Estos modelos suelen combinar modelos de difusión con otros modelos, como codificadores de texto y módulos de atención cruzada, para permitir la generación condicionada por texto. [ 5 ]
Además de la visión por computadora, los modelos de difusión también han encontrado aplicaciones en el procesamiento del lenguaje natural [ 6 ] como la generación de texto [ 7 ] y el resumen , [ 8 ] la generación de sonido, [ 9 ] y el aprendizaje por refuerzo . [ 10 ] [ 11 ]
Modelo de difusión con eliminación de ruido
Termodinámica del no equilibrio
Los modelos de difusión se introdujeron en 2015 como un método para entrenar un modelo que puede muestrear a partir de una distribución de probabilidad altamente compleja. Utilizaron técnicas de la termodinámica del no equilibrio , especialmente la difusión . [ 12 ]
Consideremos, por ejemplo, cómo se podría modelar la distribución de todas las fotos que ocurren de forma natural. Cada imagen es un punto en el espacio de todas las imágenes, y la distribución de las fotos que ocurren de forma natural es una "nube" en el espacio que, al agregar ruido repetidamente a las imágenes, se difunde hacia el resto del espacio de imágenes, hasta que la nube se vuelve prácticamente indistinguible de una distribución gaussiana.Un modelo que permita revertir aproximadamente la difusión puede utilizarse para muestrear la distribución original. Esto se estudia en la termodinámica del "no equilibrio", ya que la distribución inicial no se encuentra en equilibrio, a diferencia de la distribución final.
La distribución de equilibrio es la distribución gaussiana., con pdfEsta es simplemente la distribución de Maxwell-Boltzmann de partículas en un pozo de potencial .A temperatura 1, la distribución inicial, al estar muy alejada del equilibrio, se difundiría hacia la distribución de equilibrio, realizando pasos aleatorios sesgados que son una suma de pura aleatoriedad (como un caminante browniano ) y descenso de gradiente a través del pozo de potencial. La aleatoriedad es necesaria: si las partículas solo experimentaran descenso de gradiente, todas caerían al origen, colapsando la distribución.
Modelo probabilístico de difusión con eliminación de ruido (DDPM)
El artículo de 2020 propuso el Modelo Probabilístico de Difusión de Eliminación de Ruido (DDPM), que mejora el método anterior mediante inferencia variacional . [ 3 ] [ 13 ]
Difusión hacia adelante
Para presentar el modelo, se requiere cierta notación.
- son constantes fijas.
- es la distribución normal con mediay varianza, yes la densidad de probabilidad en.
- Una barra vertical indica condicionamiento .
Un proceso de difusión hacia adelante comienza en algún punto de partida., dóndees la distribución de probabilidad que se va a aprender, luego se le agrega ruido repetidamente mediantedóndeson IID ( variables aleatorias independientes e idénticamente distribuidas ) muestras de. Los coeficientesyasegurar quesuponiendo que. Los valores dese eligen de tal manera que para cualquier distribución inicial de, si tiene un segundo momento finito, entoncesconverge a.
Todo el proceso de difusión satisface entoncesodóndees una constante de normalización y a menudo se omite. En particular, observamos quees un proceso gaussiano , lo que nos brinda una libertad considerable en la reparametrización . Por ejemplo, mediante manipulación estándar con un proceso gaussiano,En particular, observe que para grandes, la variableconverge a. Es decir, después de un proceso de difusión suficientemente largo, terminamos con algoeso está muy cerca de, con todos los rastros del originaldesaparecido.
Por ejemplo, dado quepodemos hacer una muestradirectamente "en un solo paso", en lugar de pasar por todos los pasos intermedios..
Lo sabemoses una gaussiana yes otra gaussiana. También sabemos que son independientes. Por lo tanto, podemos realizar una reparametrización:dóndeson gaussianas IID.
Hay 5 variablesy dos ecuaciones lineales. Las dos fuentes de aleatoriedad son:, que puede ser reparametrizada por rotación, ya que la distribución gaussiana IID es simétrica rotacionalmente.
Sustituyendo las ecuaciones, podemos resolver la primera reparametrización:dóndees una distribución gaussiana con media cero y varianza uno.
Para hallar el segundo, completamos la matriz de rotación:
Dado que las matrices de rotación son todas de la forma, sabemos que la matriz debe sery puesto que la inversa de una matriz de rotación es su transpuesta,
Volviendo a conectar y simplificando, tenemos
Difusión hacia atrás
La idea clave de DDPM es utilizar una red neuronal parametrizada porLa red recibe dos argumentos.y genera un vectory una matriz, de tal manera que cada paso en el proceso de difusión hacia adelante puede ser aproximadamente deshecho porEsto nos da entonces un proceso de difusión hacia atrás.definido porEl objetivo ahora es aprender los parámetros.de tal manera quees lo más cercano aen la medida de lo posible. Para ello, utilizamos la estimación de máxima verosimilitud con inferencia variacional.
Inferencia variacional
La desigualdad ELBO establece quey tomando una expectativa más, obtenemosObservamos que maximizar la cantidad de la derecha nos daría un límite inferior para la probabilidad de los datos observados. Esto nos permite realizar inferencia variacional.
Defina la función de pérdiday ahora el objetivo es minimizar la pérdida mediante descenso de gradiente estocástico . La expresión se puede simplificar a [ 14 ].dóndeno depende del parámetro y, por lo tanto, puede ignorarse. Dado quetampoco depende del parámetro, el términoTambién se puede ignorar. Esto deja soloconser minimizado.
Red de predicción de ruido
Desde, esto sugiere que deberíamos usar; sin embargo, la red no tiene acceso ay por lo tanto tiene que estimarlo en su lugar. Ahora, dado que, podemos escribir, dóndees algún ruido gaussiano desconocido. Ahora vemos que estimares equivalente a estimar.
Por lo tanto, dejemos que la red genere un vector de ruido.y deja que predigaQueda por diseñarEl documento DDPM sugería no aprenderlo (ya que resultaba en un "entrenamiento inestable y una peor calidad de la muestra"), sino fijarlo en algún valor., donde o bienarrojaron un rendimiento similar.
Con esto, la pérdida se simplifica aque puede minimizarse mediante descenso de gradiente estocástico. El artículo señaló empíricamente que una función de pérdida aún más simpledio como resultado mejores modelos.
Proceso de difusión inversa
Una vez entrenada una red de predicción de ruido, se puede utilizar para generar puntos de datos en la distribución original en un bucle de la siguiente manera:
- Calcular la estimación del ruido
- Calcular la estimación de los datos originales
- Muestra los datos anteriores
- Cambiar de hora
Modelo generativo basado en puntuación
El modelo generativo basado en puntuación es otra formulación del modelado de difusión. También se les denomina red de puntuación condicional de ruido (NCSN) o coincidencia de puntuación con dinámica de Langevin (SMLD). [ 15 ] [ 16 ] [ 17 ] [ 18 ]
Coincidencia de puntuación
La idea de las funciones de puntuación
Consideremos el problema de la generación de imágenes. Searepresentar una imagen, y dejarsea la distribución de probabilidad sobre todas las imágenes posibles. Si tenemosSi analizamos esto por nosotros mismos, podemos determinar con certeza la probabilidad de una determinada imagen. Sin embargo, en general, esto resulta intratable.
Por lo general, no nos interesa conocer la probabilidad absoluta de una imagen determinada. En cambio, solemos estar interesados en saber cuán probable es una imagen en comparación con sus vecinas inmediatas; por ejemplo, ¿cuánto más probable es una imagen de un gato en comparación con algunas variantes pequeñas del mismo? ¿Es más probable si la imagen contiene dos bigotes, tres o si se le ha añadido ruido gaussiano?
Por consiguiente, en realidad no nos interesa en absolutosí mismo, sino más bien,Esto tiene dos efectos principales:
- Primero, ya no necesitamos normalizarpero puede utilizar cualquier, dóndees cualquier constante desconocida que no nos concierne.
- Dos, estamos comparandovecinos, por
Sea la función de puntuación; luego consideremos qué podemos hacer con.
Resulta que,nos permite tomar muestras deutilizando la termodinámica. Específicamente, si tenemos una función de energía potencialy hay muchas partículas en el pozo de potencial, entonces la distribución en equilibrio termodinámico es la distribución de Boltzmann.. A temperatura, la distribución de Boltzmann es exactamente.
Por lo tanto, para modelarPodemos comenzar con una partícula muestreada en cualquier distribución conveniente (como la distribución gaussiana estándar), y luego simular el movimiento de la partícula hacia adelante según la ecuación de Langevin. y la distribución de Boltzmann es, según la ecuación de Fokker-Planck, el único equilibrio termodinámico . Por lo tanto, no importa qué distribucióntiene, la distribución deconverge en distribución acomo.
Aprender la función de puntuación
Dada una densidad, deseamos aprender una aproximación de la función de puntuaciónEsto es ajuste de puntuación . [ 19 ] Típicamente, el ajuste de puntuación se formaliza como la minimización de la función de divergencia de Fisher.. Al expandir la integral y realizar una integración por partes ,lo que nos proporciona una función de pérdida, también conocida como la regla de puntuación de Hyvärinen , que puede minimizarse mediante el descenso de gradiente estocástico.
Recocido de la función de puntuación
Supongamos que necesitamos modelar la distribución de imágenes y queremos, una imagen de ruido blanco. Ahora bien, la mayoría de las imágenes de ruido blanco no se parecen a las imágenes reales, por lo quepara grandes extensiones deEsto presenta un problema para aprender la función de puntuación, porque si no hay muestras alrededor de un punto determinado, entonces no podemos aprender la función de puntuación en ese punto. Si no conocemos la función de puntuaciónEn ese punto, entonces no podemos imponer la ecuación de evolución temporal a una partícula:Para abordar este problema, realizamos un recocido . SiSi es demasiado diferente de una distribución de ruido blanco, entonces agregamos ruido progresivamente hasta que sea indistinguible de una. Es decir, realizamos una difusión hacia adelante, luego aprendemos la función de puntuación y luego usamos la función de puntuación para realizar una difusión hacia atrás.
procesos de difusión continua
Proceso de difusión hacia adelante
Consideremos nuevamente el proceso de difusión hacia adelante, pero esta vez en tiempo continuo:Al tomar elEn el límite, obtenemos un proceso de difusión continuo, en forma de ecuación diferencial estocástica :dóndees un proceso de Wiener (movimiento browniano multidimensional).
Ahora bien, la ecuación es precisamente un caso especial de la ecuación de Langevin sobreamortiguada.dóndees el tensor de difusión,es la temperatura yes el campo de energía potencial. Si sustituimos enRecuperamos la ecuación anterior. Esto explica por qué la expresión "dinámica de Langevin" se utiliza a veces en los modelos de difusión.
Ahora bien, la ecuación anterior es para el movimiento estocástico de una sola partícula. Supongamos que tenemos una nube de partículas distribuidas segúnen ese momento, luego, después de mucho tiempo, la nube de partículas se asentaría en la distribución estable de. Dejarsea la densidad de la nube de partículas en el tiempo, entonces tenemosy el objetivo es, de alguna manera, revertir el proceso, para poder empezar por el final y volver a difundirlo hasta el principio.
Según la ecuación de Fokker-Planck , la densidad de la nube evoluciona de acuerdo condóndees la dimensión del espacio, yes el operador de Laplace . Equivalentemente,
Proceso de difusión inversa
Si hemos resueltopor tiempo, entonces podemos revertir exactamente la evolución de la nube. Supongamos que comenzamos con otra nube de partículas con densidady dejar que las partículas en la nube evolucionen según
Luego, al sustituir en la ecuación de Fokker-Planck, encontramos que. Por lo tanto, esta nube de puntos es la nube original, que evoluciona hacia atrás. [ 20 ]
Red de puntuación condicional de ruido (NCSN)
En el límite continuo, y entonces En particular, vemos que podemos tomar muestras directamente de cualquier punto en el proceso de difusión continua sin pasar por los pasos intermedios, tomando primero muestras., entonces obtenerEs decir, podemos tomar muestras rápidamente.para cualquier.
Ahora, definamos una determinada distribución de probabilidad.encima, entonces la función de pérdida de coincidencia de puntuación se define como la divergencia de Fisher esperada: Después del entrenamiento,, por lo que podemos realizar el proceso de difusión hacia atrás mediante el muestreo inicial., luego integrando el SDE dea: Esto se puede hacer mediante cualquier método de integración de EDE, como el método de Euler-Maruyama .
El nombre "red de puntuación condicional de ruido" se explica de la siguiente manera:
- "red", porquese implementa como una red neuronal.
- "puntuación", porque la salida de la red se interpreta como una aproximación a la función de puntuación..
- "condicional al ruido", porquees igual aLa imagen se ve difuminada por un ruido gaussiano añadido que aumenta con el tiempo, por lo que la función de puntuación depende de la cantidad de ruido añadido.
Su equivalencia
DDPM y los modelos generativos basados en puntuación son equivalentes. [ 16 ] [ 1 ] [ 21 ] Esto significa que una red entrenada con DDPM puede usarse como NCSN, y viceversa.
Sabemos que, por lo tanto, según la fórmula de Tweedie , tenemos Como se describió anteriormente, la función de pérdida DDPM escon dónde. Mediante un cambio de variables, y el término interior se convierte en una regresión de mínimos cuadrados, por lo que si la red realmente alcanza el mínimo global de pérdida, entonces tenemos
Por lo tanto, dada una buena red basada en puntuación, su puntuación predicha es una buena predicción del ruido (después de escalar por), y por lo tanto se puede utilizar para la reducción de ruido.
Por el contrario, el límite continuode la ecuación hacia atrás nos da precisamente la misma ecuación que la difusión basada en puntuaciones: De este modo, en pasos infinitesimales de DDPM, una red de eliminación de ruido realiza una difusión basada en puntuaciones.
Variantes principales
Horario de ruido

En DDPM, la secuencia de númerosSe denomina programa de ruido (de tiempo discreto) . En general, considérese una función monótona estrictamente creciente.de tipo, como la función sigmoide . En ese caso, un programa de ruido es una secuencia de números reales.Luego define una secuencia de ruidos., que luego deriva las otras cantidades.
Para utilizar programas de ruido arbitrarios, en lugar de entrenar un modelo de predicción de ruido, uno entrena.
De manera similar, para la red de puntuación condicional de ruido, en lugar de entrenar, uno entrena.
Modelo implícito de difusión de eliminación de ruido (DDIM)
El método DDPM original para generar imágenes es lento, ya que el proceso de difusión hacia adelante suele tardarpara hacer la distribución depara parecer cercano a Gaussiana. Sin embargo, esto significa que el proceso de difusión hacia atrás también toma 1000 pasos. A diferencia del proceso de difusión hacia adelante, que puede omitir pasos comoes gaussiana para todosEl proceso de difusión hacia atrás no permite saltarse pasos. Por ejemplo, para muestrearrequiere que el modelo primero realice un muestreo.Intentando tomar muestras directamentenos obligaría a marginarnos, lo cual suele ser intratable.
DDIM [ 22 ] es un método que toma cualquier modelo entrenado con la función de pérdida DDPM y lo utiliza para muestrear omitiendo algunos pasos, sacrificando una cantidad ajustable de calidad. Si generamos el caso de cadena markoviana en DDPM a un caso no markoviano, DDIM corresponde al caso en que el proceso inverso tiene una varianza igual a 0. En otras palabras, el proceso inverso (y también el proceso directo) es determinista. Al usar menos pasos de muestreo, DDIM supera a DDPM.
En detalle, el método de muestreo DDIM es el siguiente. Se comienza con el proceso de difusión directa.. Luego, durante el proceso de eliminación de ruido hacia atrás, dado, los datos originales se estiman comoEntonces el proceso de difusión hacia atrás puede saltar a cualquier paso.y la siguiente muestra sin ruido esdóndees un número real arbitrario dentro del rango, yes un ruido gaussiano recién muestreado. [ 14 ] Si todoEntonces, el proceso inverso se vuelve determinista, y este caso especial de DDIM también se denomina "DDIM". El artículo original señaló que, cuando el proceso es determinista, las muestras generadas con solo 20 pasos son ya muy similares a las generadas con 1000 pasos a un nivel superior.
El artículo original recomendaba definir un único "valor eta"., de tal manera que. Cuando, este es el DDPM original. CuandoEste es el DDIM totalmente determinista. Para valores intermedios, el proceso interpola entre ellos.
Por equivalencia, el algoritmo DDIM también se aplica a los modelos de difusión basados en puntuaciones.
modelo de difusión latente (LDM)
Dado que el modelo de difusión es un método general para modelar distribuciones de probabilidad, si se desea modelar una distribución sobre imágenes, primero se pueden codificar las imágenes en un espacio de menor dimensión mediante un codificador, y luego usar un modelo de difusión para modelar la distribución sobre las imágenes codificadas. Posteriormente, para generar una imagen, se puede muestrear a partir del modelo de difusión y luego usar un decodificador para convertirlo en una imagen. [ 23 ]
El par codificador-decodificador suele ser un autoencoder variacional (VAE).
Mejoras arquitectónicas
[ 24 ] propusieron varias mejoras arquitectónicas. Por ejemplo, propusieron la interpolación en el espacio logarítmico durante el muestreo hacia atrás. En lugar de muestrear desde, recomendaron tomar muestras depara un parámetro aprendido.
En el formalismo de predicción v , la fórmula de ruidose reparametriza mediante un ángulode tal manera quey una "velocidad" definida porLa red está entrenada para predecir la velocidad.y la eliminación de ruido se realiza mediante. [ 25 ] Se descubrió que esta parametrización mejoraba el rendimiento, ya que el modelo se puede entrenar para alcanzar el ruido total (es decir,) y luego invertirlo, mientras que la parametrización estándar nunca alcanza el ruido total ya queSiempre es cierto. [ 26 ]
Guía del clasificador
En 2021 se propuso la guía del clasificador para mejorar la generación condicional de clases mediante el uso de un clasificador. La publicación original utilizó codificadores de texto CLIP para mejorar la generación de imágenes condicional de texto. [ 27 ]
Supongamos que deseamos muestrear no de toda la distribución de imágenes, sino condicionalmente a la descripción de la imagen. No queremos muestrear una imagen genérica, sino una imagen que se ajuste a la descripción "gato negro con ojos rojos". En general, queremos muestrear de la distribución., dóndeabarca imágenes yabarca diferentes clases de imágenes (una descripción como "gato negro con ojos rojos" es simplemente una clase muy detallada, y una clase "gato" es simplemente una descripción muy vaga).
Desde la perspectiva del modelo de canal ruidoso , podemos entender el proceso de la siguiente manera: Para generar una imagencondicionado a la descripción, imaginamos que el solicitante realmente tenía en mente una imagen, pero la imagen pasa a través de un canal ruidoso y sale distorsionada, comoLa generación de imágenes no es entonces más que inferir cuállo que el solicitante tenía en mente.
En otras palabras, la generación de imágenes condicional es simplemente "traducir de un lenguaje textual a un lenguaje pictórico". Luego, como en el modelo de canal ruidoso, usamos el teorema de Bayes para obtener En otras palabras, si tenemos un buen modelo del espacio de todas las imágenes y un buen traductor de imagen a clase, obtenemos un traductor de clase a imagen "gratis". En la ecuación para la difusión hacia atrás, la puntuaciónpuede ser reemplazado por dóndees la función de puntuación, entrenada como se describió anteriormente, yse encuentra utilizando un clasificador de imágenes diferenciable.
Durante el proceso de difusión, necesitamos condicionar el tiempo, dandoAunque, por lo general el modelo clasificador no depende del tiempo, en cuyo caso.
La guía del clasificador se define para el gradiente de la función de puntuación, por lo tanto para la red de difusión basada en puntuación, pero como se señaló anteriormente, los modelos de difusión basados en puntuación son equivalentes a los modelos de eliminación de ruido pory de manera similar,. Por lo tanto, la guía del clasificador también funciona para la difusión de eliminación de ruido, utilizando la predicción de ruido modificada: [ 27 ]
Con temperatura
El modelo de difusión guiado por clasificador toma muestras de, que se concentra en torno a la estimación a posteriori máximaSi queremos forzar al modelo a moverse hacia la estimación de máxima verosimilitud, podemos usar dóndees interpretable como temperatura inversa . En el contexto de los modelos de difusión, se suele denominar escala de guía . Un valor altoobligaría al modelo a muestrear a partir de una distribución concentrada alrededor de. Esto a veces mejora la calidad de las imágenes generadas. [ 27 ]
Esto introduce una modificación en la ecuación anterior:Para los modelos de eliminación de ruido, corresponde a [ 28 ].
Guía sin clasificadores (CFG)
Si no tenemos un clasificador, aún podríamos extraer uno del propio modelo de imagen: [ 28 ] Este modelo se suele entrenar presentándole ambosy, lo que le permite modelar ambosy.
Cabe señalar que, para CFG, el modelo de difusión no puede ser simplemente un modelo generativo de toda la distribución de datos.Debe ser un modelo generativo condicional.Por ejemplo, en la difusión estable, la estructura principal de difusión toma como entrada un modelo ruidoso., un tiempoy un vector de condicionamiento(como un vector que codifica una indicación de texto) y produce una predicción de ruido..
Para los modelos de eliminación de ruido, corresponde aComo se muestrea mediante DDIM, el algoritmo se puede escribir como [ 29 ].Una técnica similar se aplica al muestreo de modelos de lenguaje. Además, si la generación incondicionales reemplazado por, entonces resulta en una incitación negativa, que aleja a la generación decondición. [ 30 ] [ 31 ]
Muestras
Dado un modelo de difusión, se puede considerar como un proceso continuo y muestrear a partir de él integrando una EDE, o se puede considerar como un proceso discreto y muestrear a partir de él iterando los pasos discretos. La elección del " programa de ruido "También puede afectar la calidad de las muestras. Un programa de ruido es una función que envía un número natural a un nivel de ruido:Un horario de ruido se especifica con mayor frecuencia mediante un mapa.Las dos definiciones son equivalentes, ya que.
Desde la perspectiva de DDPM, se puede usar el propio DDPM (con ruido) o DDIM (con cantidad de ruido ajustable). El caso en el que se agrega ruido a veces se denomina muestreo ancestral. [ 32 ] Se puede interpolar entre ruido y ausencia de ruido. La cantidad de ruido se denota("valor eta") en el documento DDIM, conque denota ausencia de ruido (como en DDIM determinista ), yque denota ruido completo (como en DDPM).
Desde la perspectiva de las EDE, se puede utilizar cualquiera de los métodos de integración numérica , como el método de Euler-Maruyama , el método de Heun , los métodos lineales multipaso , etc. Al igual que en el caso discreto, se puede añadir una cantidad ajustable de ruido durante la integración. [ 33 ]
Se ha realizado un estudio y una comparación de muestreadores en el contexto de la generación de imágenes. [ 34 ]
Otros ejemplos
Las variantes notables incluyen [ 35 ] modelo generativo de flujo de Poisson, [ 36 ] modelo de consistencia, [ 37 ] difusión de Langevin críticamente amortiguada, [ 38 ] GenPhys, [ 39 ] difusión fría, [ 40 ] etc.
Modelo de difusión basado en el flujo
En abstracto, la idea del modelo de difusión es tomar una distribución de probabilidad desconocida (la distribución de imágenes de aspecto natural) y luego convertirla progresivamente en una distribución de probabilidad conocida (distribución gaussiana estándar), construyendo una trayectoria de probabilidad absolutamente continua que las conecte. La trayectoria de probabilidad está definida implícitamente por la función de puntuación..
En los modelos de difusión con eliminación de ruido, el proceso directo añade ruido y el proceso inverso lo elimina. Ambos procesos son EDE , aunque el proceso directo es integrable en forma cerrada, por lo que puede realizarse sin coste computacional. El proceso inverso no es integrable en forma cerrada, por lo que debe integrarse paso a paso mediante solucionadores de EDE estándar, lo que puede resultar muy costoso. La trayectoria de probabilidad en el modelo de difusión se define mediante un proceso de Itô y se puede obtener el proceso determinista utilizando la formulación de flujo de EDO de probabilidad. [ 1 ]
En los modelos de difusión basados en flujo, el proceso directo es un flujo determinista a lo largo de un campo vectorial dependiente del tiempo, y el proceso inverso también es un flujo determinista a lo largo del mismo campo vectorial, pero en sentido contrario. Ambos procesos son soluciones de ecuaciones diferenciales ordinarias (EDO) . Si el campo vectorial se comporta correctamente, la EDO también se comportará correctamente.
Dadas dos distribucionesyUn modelo basado en el flujo es un campo de velocidad dependiente del tiempo.en, de tal manera que si comenzamos tomando un puntoy dejar que se mueva según el campo de velocidad: terminamos con un puntoLa soluciónLa ecuación diferencial ordinaria anterior define una trayectoria de probabilidad.por el operador de medida pushforward . En particular,.
La trayectoria de probabilidad y el campo de velocidad también satisfacen la ecuación de continuidad , en el sentido de distribución de probabilidad: Para construir una ruta de probabilidad, comenzamos construyendo una ruta de probabilidad condicional.y el campo de velocidad condicional correspondienteen alguna distribución condicionalUna opción natural es la trayectoria de probabilidad condicional gaussiana: El campo de velocidad condicional que corresponde a la trayectoria geodésica entre la trayectoria gaussiana condicional es La trayectoria de probabilidad y el campo de velocidad se calculan luego marginalizando
Flujo de transporte óptimo
La idea del flujo de transporte óptimo [ 41 ] es construir una ruta de probabilidad que minimice la métrica de Wasserstein . La distribución sobre la que condicionamos es una aproximación del plan de transporte óptimo entrey:y, dóndees el plan de transporte óptimo, que puede aproximarse mediante el transporte óptimo por minilotes. Si el tamaño del lote no es grande, el transporte que calcula puede estar muy lejos del transporte óptimo real.
Flujo rectificado
La idea del flujo rectificado [ 42 ] [ 43 ] consiste en aprender un modelo de flujo tal que la velocidad sea casi constante a lo largo de cada trayectoria de flujo. Esto es beneficioso, porque podemos integrar a lo largo de dicho campo vectorial con muy pocos pasos. Por ejemplo, si una EDOsigue caminos perfectamente rectos, se simplifica a, lo que permite obtener soluciones exactas en un solo paso. En la práctica, no podemos alcanzar tal perfección, pero cuando el campo de flujo se aproxima a ella, podemos dar unos pocos pasos grandes en lugar de muchos pasos pequeños.
La idea general es comenzar con dos distribuciones.y, luego construir un campo de flujoA partir de él, aplique repetidamente una operación de "reflujo" para obtener campos de flujo sucesivos., cada uno más recto que el anterior. Cuando el campo de flujo es lo suficientemente recto para la aplicación, nos detenemos.
En general, para cualquier proceso diferenciable en el tiempo,se puede estimar resolviendo:
En el flujo rectificado, al inyectar fuertes premisas de que las trayectorias intermedias son rectas, se puede lograr tanto relevancia teórica para el transporte óptimo como eficiencia computacional, ya que las EDO con trayectorias rectas se pueden simular con precisión sin discretización temporal.

Específicamente, el flujo rectificado busca hacer coincidir una EDO con las distribuciones marginales de la interpolación lineal entre puntos de las distribuciones.y. Observaciones dadasy, la interpolación lineal canónicaproduce un caso trivial, que no puede ser simulado causalmente sinPara abordar esto,se "proyecta" en un espacio de EDO causalmente simulables, minimizando la pérdida de mínimos cuadrados con respecto a la dirección:
El par de datospuede ser cualquier acoplamiento dey, típicamente independientes (es decir,) obtenido mediante la combinación aleatoria de observaciones dey. Este proceso asegura que las trayectorias reflejen fielmente el mapa de densidad detrayectorias, pero redirigir en las intersecciones para asegurar la causalidad.

Un aspecto distintivo del flujo rectificado es su capacidad de " reflujo ", que endereza la trayectoria de las rutas de las EDO. Denotemos el flujo rectificado comoinducido porcomo. Aplicando recursivamente estoEl operador genera una serie de flujos rectificados.Este proceso de "reflujo" no solo reduce los costos de transporte, sino que también endereza las rutas de los flujos rectificados, lo que hace que...caminos más rectos con aumento.
El flujo rectificado incluye una extensión no lineal donde la interpolación linealse reemplaza con cualquier curva diferenciable en el tiempo que conectey, dado porEste marco abarca DDIM y EDO de flujo de probabilidad como casos especiales, con elecciones particulares dey. Sin embargo, en el caso donde la trayectoria deno es recto, el proceso de reflujo ya no garantiza una reducción en los costos de transporte convexos, y tampoco endereza ya las trayectorias de. [ 42 ]
Estas formulaciones de flujo lineal se descubrieron de forma independiente y se adaptaron desde una perspectiva diferente para problemas inversos supervisados. Por ejemplo, la Inversión por Iteración Directa (InDI) formula la restauración de imágenes aprendiendo una EDO de flujo residual que invierte iterativamente una interpolación lineal entre una entrada degradada y un objetivo de alta calidad para evitar la regresión a la media. InDI es eficaz para diversas tareas de restauración de imágenes. [ 44 ]
Elección de la arquitectura


Modelo de difusión
Para generar imágenes mediante DDPM, necesitamos una red neuronal que requiera tiempo.y una imagen ruidosay predice un ruidode ello. Dado que predecir el ruido es lo mismo que predecir la imagen sin ruido, entonces restarlo deLas arquitecturas de eliminación de ruido tienden a funcionar bien. Por ejemplo, la U-Net , que ha demostrado ser eficaz para eliminar el ruido de las imágenes, se utiliza a menudo para eliminar el ruido de los modelos de difusión que generan imágenes. [ 45 ]
Para DDPM, la arquitectura subyacente ("columna vertebral") no tiene por qué ser una U-Net. Simplemente tiene que predecir el ruido de alguna manera. Por ejemplo, el transformador de difusión (DiT) utiliza un Transformer para predecir la media y la covarianza diagonal del ruido, dado el condicionamiento textual y la imagen parcialmente sin ruido. Es lo mismo que el modelo de difusión de eliminación de ruido estándar basado en U-Net, con un Transformer que reemplaza a la U-Net. [ 46 ] También se puede aplicar un Transformer de mezcla de expertos . [ 47 ]
DDPM se puede utilizar para modelar distribuciones de datos generales, no solo imágenes de aspecto natural. Por ejemplo, Human Motion Diffusion [ 48 ] modela la trayectoria del movimiento humano mediante DDPM. Cada trayectoria de movimiento humano es una secuencia de poses, representadas por rotaciones o posiciones de las articulaciones. Utiliza una red Transformer para generar una trayectoria con menos ruido a partir de una con mucho ruido.
Acondicionamiento
El modelo de difusión básico solo puede generar imágenes de forma incondicional a partir de toda la distribución. Por ejemplo, un modelo de difusión entrenado con ImageNet generaría imágenes que se asemejan a una imagen aleatoria de ImageNet. Para generar imágenes de una sola categoría, sería necesario imponer una condición y luego muestrear a partir de la distribución condicional. Cualquiera que sea la condición que se desee imponer, primero se debe convertir el condicionamiento en un vector de números de coma flotante y luego introducirlo en la red neuronal del modelo de difusión subyacente. Sin embargo, existe libertad para elegir cómo convertir el condicionamiento en un vector.
Por ejemplo, la difusión estable impone un condicionamiento en forma de mecanismo de atención cruzada , donde la consulta es una representación intermedia de la imagen en la U-Net, y tanto la clave como el valor son los vectores de condicionamiento. El condicionamiento se puede aplicar selectivamente solo a partes de una imagen, y se pueden ajustar nuevos tipos de condicionamientos sobre el modelo base, como se usa en ControlNet. [ 49 ]
Como ejemplo particularmente sencillo, consideremos el relleno de imágenes . Las condiciones son:, la imagen de referencia y, la máscara de relleno . El condicionamiento se impone en cada paso del proceso de difusión hacia atrás, mediante el muestreo inicial., una versión ruidosa deluego reemplazandocon, dóndesignifica multiplicación elemento a elemento . [ 50 ] Otra aplicación del mecanismo de atención cruzada es la edición de imágenes de indicación a indicación. [ 51 ]
El condicionamiento no se limita a generar imágenes de una categoría específica o según un pie de foto específico (como en la conversión de texto a imagen). Por ejemplo, [ 48 ] demostró la generación de movimiento humano condicionado a un clip de audio de una persona caminando (lo que permite sincronizar el movimiento con una banda sonora), o a un vídeo de una persona corriendo, o a una descripción textual del movimiento humano, etc. Para conocer la formulación matemática de los modelos de difusión condicional, véase el resumen metodológico en [ 52 ] .
Ampliación de escala
Como generar una imagen lleva mucho tiempo, se puede intentar generar una imagen pequeña mediante un modelo de difusión base y luego ampliarla con otros modelos. La ampliación se puede realizar mediante GAN , [ 53 ] Transformer , [ 54 ] o métodos de procesamiento de señales como el remuestreo de Lanczos .
Los propios modelos de difusión pueden utilizarse para realizar el escalado ascendente. El modelo de difusión en cascada apila varios modelos de difusión uno tras otro, al estilo de las GAN progresivas . El nivel más bajo es un modelo de difusión estándar que genera una imagen de 32x32 píxeles; a continuación, la imagen se escala mediante un modelo de difusión entrenado específicamente para el escalado ascendente, y el proceso se repite. [ 45 ]
En más detalle, el escalador de difusión se entrena de la siguiente manera: [ 45 ]
- Muestra, dóndees la imagen de alta resolución,es la misma imagen pero reducida a una resolución baja, yes el condicionamiento, que puede ser el pie de foto de la imagen, la clase de la imagen, etc.
- Muestra de dos ruidos blancos, dos pasos de tiempoCalcula las versiones con ruido de las imágenes de alta y baja resolución:.
- Entrenar la red de eliminación de ruido para predecirdado. Es decir, aplicar el descenso de gradiente enen la pérdida L2.
Ejemplos
Esta sección recopila algunos modelos de difusión destacados y describe brevemente su arquitectura.
OpenAI
La serie DALL-E de OpenAI son modelos de difusión de imágenes condicionados al texto.
La primera versión de DALL-E (2021) no es propiamente un modelo de difusión. En cambio, utiliza una arquitectura Transformer que genera de forma autorregresiva una secuencia de tokens, la cual es convertida posteriormente en una imagen por el decodificador de un VAE discreto. Junto con DALL-E se lanzó el clasificador CLIP, que se utilizaba para clasificar las imágenes generadas según su grado de coincidencia con el texto.
GLIDE (2022–03) [ 55 ] es un modelo de difusión de 3.5 mil millones, y se publicó una versión pequeña. [ 5 ] Poco después, se publicó DALL-E 2 (2022–04). [ 56 ] DALL-E 2 es un modelo de difusión en cascada de 3.5 mil millones que genera imágenes a partir de texto "invirtiendo el codificador de imágenes CLIP", técnica que denominaron "unCLIP".
El método unCLIP consta de cuatro modelos: un codificador de imágenes CLIP, un codificador de texto CLIP, un decodificador de imágenes y un modelo previo (que puede ser un modelo de difusión o un modelo autorregresivo). Durante el entrenamiento, el modelo previo se entrena para convertir las codificaciones de imágenes CLIP en codificaciones de texto CLIP. El decodificador de imágenes se entrena para convertir las codificaciones de imágenes CLIP de nuevo en imágenes. Durante la inferencia, el codificador de texto CLIP convierte un texto en un vector, luego el modelo previo lo convierte en una codificación de imagen y, finalmente, el decodificador de imágenes lo convierte en una imagen.
Sora (2024–02) es un modelo Transformer de difusión (DiT).
Lightricks
LTX es una familia de modelos de base de video de inteligencia artificial de código abierto desarrollados por Lightricks , lanzados por primera vez en noviembre de 2024. [ 57 ] Los modelos más recientes, LTX-2, crean videos basados en indicaciones del usuario , condicionadas por texto, imágenes, video o audio, y capaces de generar audio y video de manera unificada. [ 58 ] [ 59 ] Fueron precedidos por LTX Video, que se lanzó en 2024 como el primer modelo de texto a video de la compañía.
IA de estabilidad
Stable Diffusion (2022–08), publicado por Stability AI, consta de un modelo de difusión latente de eliminación de ruido (860 millones de parámetros), un VAE y un codificador de texto. La red de eliminación de ruido es una U-Net, con bloques de atención cruzada para permitir la generación condicional de imágenes. [ 60 ] [ 23 ]
Stable Diffusion 3 (2024–03) [ 61 ] cambió el modelo de difusión latente de UNet a un modelo Transformer, por lo que es un DiT. Utiliza flujo rectificado.
Stable Video 4D (2024–07) [ 62 ] es un modelo de difusión latente para vídeos de objetos 3D.
Imagen (2022) [ 63 ] [ 64 ] utiliza un modelo de lenguaje T5-XXL para codificar el texto de entrada en un vector de incrustación. Es un modelo de difusión en cascada con tres submodelos. El primer paso elimina el ruido blanco en una imagen de 64×64, condicionado al vector de incrustación del texto. Este modelo tiene 2B parámetros. El segundo paso amplía la imagen de 64×64→256×256, condicionado a la incrustación. Este modelo tiene 650M parámetros. El tercer paso es similar, ampliando de 256×256→1024×1024. Este modelo tiene 400M parámetros. Las tres redes de eliminación de ruido son todas U-Nets.
Muse (2023–01) [ 65 ] no es un modelo de difusión, sino un Transformer solo con codificador que está entrenado para predecir tokens de imágenes enmascaradas a partir de tokens de imágenes sin enmascarar.
Imagen 2 (2023–12) también se basa en la difusión. Puede generar imágenes a partir de una indicación que combina imágenes y texto. No hay más información disponible. [ 66 ] Imagen 3 (2024–05) también. No hay más información disponible. [ 67 ]
Veo (2024) genera vídeos mediante difusión latente. La difusión está condicionada a un vector que codifica tanto una indicación de texto como una indicación de imagen. [ 68 ]
Meta
Make-A-Video (2022) es un modelo de difusión de texto a vídeo. [ 69 ] [ 70 ]
CM3leon (2023) no es un modelo de difusión, sino un Transformer autorregresivo con enmascaramiento causal, con una arquitectura prácticamente idéntica a la de LLaMa -2. [ 71 ] [ 72 ]

Transfusion (2024) es un Transformer que combina la generación de texto autorregresiva y la difusión de eliminación de ruido. Específicamente, genera texto de forma autorregresiva (con enmascaramiento causal) y genera imágenes mediante la eliminación de ruido varias veces sobre los tokens de imagen (con atención de todos a todos). [ 73 ]
Movie Gen (2024) es una serie de transformadores de difusión que operan en el espacio latente y mediante la coincidencia de flujo. [ 74 ]
Véase también
Lecturas adicionales
- Artículos de revisión
- Yang, Ling (2024-09-06), YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy , consultado el 2024-09-06
- Yang, Ling; Zhang, Zhilong; Canción, Yang; Hong, Shenda; Xu, Runsheng; Zhao, Yue; Zhang, Wentao; Cui, Bin; Yang, Ming-Hsuan (9 de noviembre de 2023). "Modelos de difusión: un estudio completo de métodos y aplicaciones" . Computación ACM. Sobrevivir . 56 (4): 105:1–105:39. arXiv : 2209.00796 . doi : 10.1145/3626235 . ISSN 0360-0300 .
- Austin, Jacob; Johnson, Daniel D.; Ho, Jonathan; Tarlow, Daniel; Rianne van den Berg (2021). "Modelos de difusión de eliminación de ruido estructurados en espacios de estados discretos". arXiv : 2107.03006 [ cs.LG ].
- Croitoru, Florinel-Alin; Hondru, Vlad; Ionescu, Radu Tudor; Shah, Mubarak (1 de septiembre de 2023). "Modelos de difusión en visión: una encuesta". Transacciones IEEE sobre análisis de patrones e inteligencia artificial . 45 (9): 10850–10869 . arXiv : 2209.04747 . Código Bib : 2023ITPAM..4510850C . doi : 10.1109/TPAMI.2023.3261988 . ISSN 0162-8828 . PMID 37030794 .
- En el artículo se omiten detalles matemáticos.
- "El poder de los modelos de difusión" . AstraBlog . 25 de septiembre de 2022. Consultado el 25 de septiembre de 2023 .
- Luo, Calvin (25 de agosto de 2022). "Comprensión de los modelos de difusión: una perspectiva unificada". arXiv : 2208.11970 [ cs.LG ].
- Weng, Lilian (11 de julio de 2021). "¿Qué son los modelos de difusión?" . lilianweng.github.io . Consultado el 25 de septiembre de 2023 .
- Tutoriales
- Nakkiran, Preetum; Bradley, Arwen; Zhou, Hattie; Advani, Madhu (2024). "Difusión paso a paso: un tutorial elemental". arXiv : 2406.08929 [ cs.LG ].
- "Guía: un código de trucos para modelos de difusión" . 26 de mayo de 2022.Descripción general de la guía de clasificación y la guía sin clasificación, con pocos detalles matemáticos.
- Catherine Higham, Desmond J. Higham y Peter Grindrod: "Modelos de difusión para inteligencia artificial generativa: una introducción para matemáticos aplicados", SIAM Review, vol. 67, n.º 3 (2025).
Referencias
- 1 2 3 4 Canción, Yang; Sohl-Dickstein, Jascha; Kingma, Diederik P.; Kumar, Abhishek; Ermón, Stefano; Poole, Ben (10 de febrero de 2021). "Modelado generativo basado en puntuaciones mediante ecuaciones diferenciales estocásticas". arXiv : 2011.13456 [ cs.LG ].
- ^ Croitoru, Florinel-Alin; Hondru, Vlad; Ionescu, Radu Tudor; Shah, Mubarak (2023). "Modelos de difusión en visión: una encuesta". Transacciones IEEE sobre análisis de patrones e inteligencia artificial . 45 (9): 10850–10869 . arXiv : 2209.04747 . Código Bib : 2023ITPAM..4510850C . doi : 10.1109/TPAMI.2023.3261988 . PMID 37030794 . S2CID 252199918 .
- 1 2 Ho, Jonathan; Jain, Ajay; Abbeel, Pieter (2020). "Modelos probabilísticos de difusión con eliminación de ruido" . Avances en sistemas de procesamiento de información neuronal . 33. Curran Associates, Inc.: 6840–6851 .
- ^ Gu, Shuyang; Chen, Dong; Bao, Jianmin; Wen, colmillo; Zhang, Bo; Chen, Dongdong; Yuan, Lu; Guo, Baining (2021). "Modelo de difusión cuantificada vectorial para síntesis de texto a imagen". arXiv : 2111.14822 [ cs.CV ].
- 1 2 GLIDE , OpenAI, 22/09/2023 , consultado el 24/09/2023
- ↑ Li, Yifan; Zhou, Kun; Zhao, Wayne Xin; Wen, Ji-Rong (agosto de 2023). «Modelos de difusión para la generación de texto no autorregresivo: una revisión» . Actas de la Trigésimo Segunda Conferencia Internacional Conjunta sobre Inteligencia Artificial. California: International Joint Conferences on Artificial Intelligence Organization. págs. 6692–6701 . arXiv : 2303.06574 . doi : 10.24963/ijcai.2023/750 . ISBN 978-1-956792-03-4.
- ↑ Xu, Weijie; Hu, Wenxiang; Wu, Fanyou; Sengamedu, Srinivasan (2023). "DeTiME: Diffusion-Enhanced Topic Modeling using Encoder-decoder based LLM" . Hallazgos de la Asociación para la Lingüística Computacional: EMNLP 2023. Stroudsburg, PA, EE. UU.: Asociación para la Lingüística Computacional: 9040–9057 . arXiv : 2310.15296 . doi : 10.18653 /v1/2023.findings-emnlp.606 .
- ↑ Zhang, Haopeng; Liu, Xiao; Zhang, Jiawei (2023). "DiffuSum: Generación mejorada de resumen extractivo con difusión" . Hallazgos de la Asociación para la Lingüística Computacional: ACL 2023. Stroudsburg, PA, EE. UU.: Asociación para la Lingüística Computacional: 13089–13100 . arXiv : 2305.01735 . doi : 10.18653/v1/2023.findings-acl.828 .
- ↑ Yang, Dongchao; Yu, Jianwei; Wang, Helin; Wang, Wen; Weng, Chao; Zou, Yuexian; Yu, Dong (2023). "Diffsound: Discrete Diffusion Model for Text-to-Sound Generation" . IEEE/ACM Transactions on Audio, Speech, and Language Processing . 31 : 1720–1733 . arXiv : 2207.09983 . Bibcode : 2023ITASL..31.1720Y . doi : 10.1109/taslp.2023.3268730 . ISSN 2329-9290 .
- ↑ Janner, Michael; Du, Yilun; Tenenbaum, Joshua B.; Levine, Sergey (2022-12-20). "Planificación con difusión para la síntesis de comportamiento flexible". arXiv : 2205.09991 [ cs.LG ].
- ^ Chi, Cheng; Xu, Zhenjia; Feng, Siyuan; Cousineau, Eric; Du, Yilun; Burchfiel, Benjamín; Tedrake, Russ; Canción, Shuran (14 de marzo de 2024). "Política de difusión: aprendizaje de políticas visomotoras a través de la difusión de la acción". arXiv : 2303.04137 [ cs.RO ].
- ↑ Sohl-Dickstein, Jascha; Weiss, Eric; Maheswaranathan, Niru; Ganguli, Surya (2015-06-01). "Aprendizaje profundo no supervisado utilizando termodinámica de no equilibrio" (PDF) . Actas de la 32.ª Conferencia Internacional sobre Aprendizaje Automático . 37. PMLR: 2256–2265 . arXiv : 1503.03585 .
- ^ Ho, Jonathan (20 de junio de 2020), hojonathanho/diffusion , consultado el 7 de septiembre de 2024
- 1 2 Weng, Lilian (11 de julio de 2021). "¿Qué son los modelos de difusión?" . lilianweng.github.io . Consultado el 24 de septiembre de 2023 .
- ↑ "Modelado generativo mediante la estimación de gradientes de la distribución de datos | Yang Song" . yang-song.net . Consultado el 24 de septiembre de 2023 .
- 1 2 Song, Yang; Ermon, Stefano (2019). "Modelado generativo mediante la estimación de gradientes de la distribución de datos" . Advances in Neural Information Processing Systems . 32. Curran Associates, Inc. arXiv : 1907.05600 .
- ^ Canción, Yang; Sohl-Dickstein, Jascha; Kingma, Diederik P.; Kumar, Abhishek; Ermón, Stefano; Poole, Ben (10 de febrero de 2021). "Modelado generativo basado en puntuaciones mediante ecuaciones diferenciales estocásticas". arXiv : 2011.13456 [ cs.LG ].
- ↑ ermongroup/ncsn , ermongroup, 2019 , consultado el 7 de septiembre de 2024
- ↑ "Sliced Score Matching: A Scalable Approach to Density and Score Estimation | Yang Song" . yang-song.net . Consultado el 24 de septiembre de 2023 .
- ↑ Anderson, Brian DO (mayo de 1982). "Modelos de ecuaciones de difusión en tiempo inverso" . Procesos estocásticos y sus aplicaciones . 12 (3): 313– 326. doi : 10.1016/0304-4149(82)90051-5 . ISSN 0304-4149 .
- ↑ Luo, Calvin (2022). "Understanding Diffusion Models: A Unified Perspective". arXiv : 2208.11970v1 [ cs.LG ].
- ↑ Song, Jiaming; Meng, Chenlin; Ermon, Stefano (3 de octubre de 2023). "Denoising Diffusion Implicit Models". arXiv : 2010.02502 [ cs.LG ].
- ^ Rombach , Robin; Blattmann, Andreas; Lorenz, Dominik; Esser, Patricio; Ommer, Björn (13 de abril de 2022). "Síntesis de imágenes de alta resolución con modelos de difusión latente". arXiv : 2112.10752 [ cs.CV ].
- ↑ Nichol, Alexander Quinn; Dhariwal, Prafulla (1 de julio de 2021). "Modelos probabilísticos de difusión con eliminación de ruido mejorados" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 8162–8171 .
- ↑ Salimans, Tim; Ho, Jonathan (06-10-2021). Destilación progresiva para el muestreo rápido de modelos de difusión . Décima Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR 2022).
- ↑ Lin, Shanchuan; Liu, Bingchen; Li, Jiashi; Yang, Xiao (2024). Los esquemas comunes de ruido de difusión y los pasos de muestreo son defectuosos . Conferencia de invierno IEEE/CVF sobre aplicaciones de visión por computadora (WACV). págs. 5404–5411 .
- ^ Dhariwal , Prafulla ; Nichol, Alex (1 de junio de 2021). "Los modelos de difusión superan a las GAN en síntesis de imágenes". arXiv : 2105.05233 [ cs.LG ].
- 1 2 Ho, Jonathan; Salimans, Tim (2022-07-25). "Guía de difusión sin clasificadores". arXiv : 2207.12598 [ cs.LG ].
- ↑ Chung, Hyungjin; Kim, Jeongsol; Park, Geon Yeong; Nam, Hyelin; Ye, Jong Chul (2024-06-12). "CFG++: Guía sin clasificador con restricciones de variedad para modelos de difusión". arXiv : 2406.08070 [ cs.CV ].
- ↑ Sanchez, Guillaume; Fan, Honglu; Spangher, Alexander; Levi, Elad; Ammanamanchi, Pawan Sasanka; Biderman, Stella (30 de junio de 2023). "Manténgase en el tema con la guía sin clasificadores". arXiv : 2306.17806 [ cs.CL ].
- ↑ Armandpour, Mohammadreza; Sadeghian, Ali; Zheng, Huangjie; Sadeghian, Amir; Zhou, Mingyuan (26 de abril de 2023). "Reimaginar el algoritmo de aviso negativo: transformar la difusión 2D en 3D, aliviar el problema de Janus y más allá". arXiv : 2304.04968 [ cs.CV ].
- ↑ Yang, Ling; Zhang, Zhilong; Canción, Yang; Hong, Shenda; Xu, Runsheng; Zhao, Yue; Zhang, Wentao; Cui, Bin; Yang, Ming-Hsuan (2022). "Modelos de difusión: un estudio completo de métodos y aplicaciones". arXiv : 2206.00364 [ cs.CV ].
- ↑ Shi, Jiaxin; Han, Kehang; Wang, Zhe; Doucet, Arnaud; Titsias, Michalis K. (2024). "Difusión enmascarada simplificada y generalizada para datos discretos". arXiv : 2406.04329 [ cs.LG ].
- ↑ Karras, Tero; Aittala, Miika; Aila, Timo; Laine, Samuli (2022). "Aclarar el espacio de diseño de modelos generativos basados en difusión". arXiv : 2206.00364v2 [ cs.CV ].
- ^ Cao, Hanqun; Tan, Cheng; Gao, Zhangyang; Xu, Yilun; Chen, Guangyong; Heng, Pheng-Ann; Li, Stan Z. (julio de 2024). "Una encuesta sobre modelos de difusión generativa". Transacciones IEEE sobre conocimiento e ingeniería de datos . 36 (7): 2814– 2830. Código bibliográfico : 2024ITKDE..36.2814C . doi : 10.1109/TKDE.2024.3361474 . ISSN 1041-4347 .
- ↑ Xu, Yilun; Liu, Ziming; Tian, Yonglong; Tong, Shangyuan; Tegmark, Max; Jaakkola, Tommi (2023-07-03). "PFGM++: Desbloqueando el potencial de los modelos generativos inspirados en la física" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 38566–38591 . arXiv : 2302.04265 .
- ↑ Song, Yang; Dhariwal, Prafulla; Chen, Mark; Sutskever, Ilya (2023-07-03). "Modelos de consistencia" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 32211–32252 .
- ↑ Dockhorn, Tim; Vahdat, Arash; Kreis, Karsten (2021-10-06). "Modelado generativo basado en puntuación con difusión de Langevin críticamente amortiguada". arXiv : 2112.07068 [ stat.ML ].
- ↑ Liu, Ziming; Luo, Di; Xu, Yilun; Jaakkola, Tommi; Tegmark, Max (2023-04-05). "GenPhys: De los procesos físicos a los modelos generativos". arXiv : 2304.02637 [ cs.LG ].
- ↑ Bansal, Arpit; Borgnia, Eitan; Chu, Hong-Min; Li, Jie; Kazemi, Hamid; Huang, Furong; Goldblum, Micah; Geiping, Jonas; Goldstein, Tom (2023-12-15). "Difusión fría: inversión de transformaciones de imágenes arbitrarias sin ruido" . Advances in Neural Information Processing Systems . 36 : 41259–41282 . arXiv : 2208.09392 .
- ↑ Tong, Alexander; Fatras, Kilian; Malkin, Nikolay; Huguet, Guillaume; Zhang, Yanlei; Rector-Brooks, Jarrid; Wolf, Guy; Bengio, Yoshua (2023-11-08). "Mejora y generalización de modelos generativos basados en flujo con transporte óptimo de minilotes" . Transactions on Machine Learning Research . arXiv : 2302.00482 . ISSN 2835-8856 .
- 1 2 3 4 Liu, Xingchao; Gong, Chengyue; Liu, Qiang (2022-09-07). "Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow". arXiv : 2209.03003 [ cs.LG ].
- ↑ Liu, Qiang (2022-09-29). "Flujo rectificado: un enfoque de preservación marginal para el transporte óptimo". arXiv : 2209.14577 [ stat.ML ].
- ↑ Delbracio, Mauricio; Milanfar, Peyman (2023). "Inversión por iteración directa: una alternativa a la difusión de eliminación de ruido para la restauración de imágenes" . Transactions on Machine Learning Research .
- 1 2 3 Ho, Jonathan; Saharia, Chitwan; Chan, William; Fleet, David J.; Norouzi, Mohammad; Salimans, Tim (2022-01-01). "Modelos de difusión en cascada para la generación de imágenes de alta fidelidad" . The Journal of Machine Learning Research . 23 (1): 47:2249–47:2281. arXiv : 2106.15282 . ISSN 1532-4435 .
- ↑ Peebles, William; Xie, Saining (marzo de 2023). "Modelos de difusión escalables con transformadores". arXiv : 2212.09748v2 [ cs.CV ].
- ^ Fei, Zhengcong; Fan, Mingyuan; Yu, Changqian; Li, Debang; Huang, Junshi (16 de julio de 2024). "Ampliación de transformadores de difusión a 16 mil millones de parámetros". arXiv : 2407.11633 [ cs.CV ].
- ^ Tevet , chico; Raab, Sigal; Gordon, Brian; Shafir, Yonatan; Cohen-Or, Daniel; Bermano, Amit H. (2022). "Modelo de difusión del movimiento humano". arXiv : 2209.14916 [ cs.CV ].
- ↑ Zhang, Lvmin; Rao, Anyi; Agrawala, Maneesh (2023). "Adding Conditional Control to Text-to-Image Diffusion Models". arXiv : 2302.05543 [ cs.CV ].
- ↑ Lugmayr, Andreas; Danelljan, Martin; Romero, Andres; Yu, Fisher; Timofte, Radu; Van Gool, Luc (2022). "RePaint: Inpainting Using Denoising Diffusion Probabilistic Models". arXiv : 2201.09865v4 [ cs.CV ].
- ↑ Hertz, Amir; Mokady, Ron; Tenenbaum, Jay; Aberman, Kfir; Pritch, Yael; Cohen-Or, Daniel (2022-08-02). "Edición de imágenes de indicación a indicación con control de atención cruzada". arXiv : 2208.01626 [ cs.CV ].
- ↑ Zhao, Zheng; Luo, Ziwei; Sjölund, Jens; Schön, Thomas (19 de junio de 2025). "Muestreo condicional dentro de modelos de difusión generativos" . Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 383 (2299). doi : 10.1098/rsta.2024.0329 . ISSN 1364-503X . PMC 12177524 .
- ↑ Wang, Xintao; Xie, Liangbin; Dong, Chao; Shan, Ying (2021). "Real-ESRGAN: Entrenamiento de superresolución ciega del mundo real con datos sintéticos puros" (PDF) . Actas de los talleres de la Conferencia Internacional IEEE/CVF sobre Visión por Computadora (ICCV), 2021. Conferencia Internacional sobre Visión por Computadora. págs. 1905–1914 . arXiv : 2107.10833 .
- ↑ Liang, Jingyun; Cao, Jiezhang; Sun, Guolei; Zhang, Kai; Van Gool, Luc; Timofte, Radu (2021). "SwinIR: Restauración de imágenes mediante Swin Transformer" (PDF) . Actas de los talleres de la Conferencia Internacional IEEE/CVF sobre Visión por Computadora (ICCV) . Conferencia Internacional sobre Visión por Computadora, 2021. pp. 1833–1844 . arXiv : 2108.10257v1 .
- ↑ Nichol, Alex; Dhariwal, Prafulla; Ramesh, Aditya; Shyam, Pranav; Mishkin, Pamela; McGrew, Bob; Sutskever, Ilya; Chen, Mark (2022-03-08). "GLIDE: Hacia la generación y edición de imágenes fotorrealistas con modelos de difusión guiados por texto". arXiv : 2112.10741 [ cs.CV ].
- ↑ Ramesh, Aditya; Dhariwal, Prafulla; Nichol, Alex; Chu, Casey; Chen, Mark (2022-04-12). "Generación jerárquica de imágenes condicionales de texto con latentes CLIP". arXiv : 2204.06125 [ cs.CV ].
- ↑ "Lightricks desafía a los gigantes de la IA con una plataforma de código abierto de texto a vídeo" . ctech . 22 de noviembre de 2024. Consultado el 23 de abril de 2026 .
- ↑ Kemper, Jonathan (11 de enero de 2026). "Lightricks publica como código abierto el modelo de vídeo de IA LTX-2 y desafía a Sora y Veo" . The Decoder . Consultado el 23 de abril de 2026 .
- ↑ Lightricks. "Lightricks lanza LTX-2: el primer modelo completo de base de vídeo con IA de código abierto" . www.prnewswire.com . Consultado el 23 de abril de 2026 .
- ↑ Alammar, Jay. "La difusión estable ilustrada" . jalammar.github.io . Consultado el 31 de octubre de 2022 .
- ↑ Esser, Patrick; Kulal, Sumith; Blattmann, Andreas; Entezari, Rahim; Müller, Jonas; Saini, Harry; Levi, Yam; Lorenz, Dominik; Sauer, Axel (2024-03-05). "Escalado de transformadores de flujo rectificados para síntesis de imágenes de alta resolución". arXiv : 2403.03206 [ cs.CV ].
- ↑ Xie, Yiming; Yao, Chun-Han; Voleti, Vikram; Jiang, Huaizu; Jampani, Varun (2024-07-24). "SV4D: Generación dinámica de contenido 3D con consistencia de múltiples fotogramas y múltiples vistas". arXiv : 2407.17470 [ cs.CV ].
- ↑ "Imagen: Modelos de difusión de texto a imagen" . imagen.research.google . Consultado el 4 de abril de 2024 .
- ↑ Saharia, Chitwan; Chan, William; Saxena, Saurabh; Li, Lala; Whang, Jay; Denton, Emily L.; Ghasemipour, Kamyar; Gontijo Lopes, Raphael; Karagol Ayan, Burcu; Salimans, Tim; Ho, Jonathan; Fleet, David J.; Norouzi, Mohammad (2022-12-06). "Modelos de difusión fotorrealistas de texto a imagen con comprensión profunda del lenguaje" . Advances in Neural Information Processing Systems . 35 : 36479–36494 . arXiv : 2205.11487 .
- ↑ Chang, Huiwen; Zhang, Han; Barber, Jarred; Maschinot, AJ; Lezama, Jose; Jiang, Lu; Yang, Ming-Hsuan; Murphy, Kevin; Freeman, William T. (2023-01-02). "Muse: Generación de texto a imagen mediante transformadores generativos enmascarados". arXiv : 2301.00704 [ cs.CV ].
- ↑ "Imagen 2: nuestra tecnología de conversión de texto a imagen más avanzada" . Google DeepMind . Consultado el 4 de abril de 2024 .
- ↑ Imagen-Equipo-Google; Baldridge, Jason; Bauer, Jakob; Bután, Mukul; Brichtova, Nicole; Bunner, Andrés; Castrejón, Lluís; Chan, Kelvin; Chen, Yichang (13 de diciembre de 2024), Imagen 3 , arXiv : 2408.07009
{{citation}}:|last1=tiene nombre genérico ( ayuda ) - ↑ "Veo" . Google DeepMind . 14 de mayo de 2024. Consultado el 17 de mayo de 2024 .
- ↑ "Presentamos Make-A-Video: un sistema de IA que genera vídeos a partir de texto" . ai.meta.com . Consultado el 20 de septiembre de 2024 .
- ↑ Singer, Uriel; Polyak, Adam; Hayes, Thomas; Yin, Xi; An, Jie; Zhang, Songyang; Hu, Qiyuan; Yang, Harry; Ashual, Oron (2022-09-29). "Make-A-Video: Generación de texto a vídeo sin datos de texto a vídeo". arXiv : 2209.14792 [ cs.CV ].
- ↑ "Presentamos CM3leon, un modelo generativo más eficiente y de última generación para texto e imágenes" . ai.meta.com . Consultado el 20 de septiembre de 2024 .
- ↑ Equipo Chameleon (16 de mayo de 2024). "Chameleon: Modelos de fundación de fusión temprana de modo mixto". arXiv : 2405.09818 [ cs.CL ].
- ^ Zhou, Chunting; Yu, Lili; Babú, Arun; Tirumala, Kushal; Yasunaga, Michihiro; Shamis, Leonidas; Kahn, Jacob; Mamá, Xuezhe; Zettlemoyer, Luke (20 de agosto de 2024). "Transfusión: predecir el siguiente token y difundir imágenes con un modelo multimodal". arXiv : 2408.11039 [ cs.AI ].
- ↑ Movie Gen: Un elenco de modelos de Media Foundation , El equipo de Movie Gen @ Meta, 4 de octubre de 2024.
- modelos de Markov
- algoritmos de aprendizaje automático