Capítulo 21 · Difusión · 9 min
Generar una imagen borrando el ruido
Stable Diffusion, Midjourney, FLUX. El proceso inverso de denoising, el papel de CLIP, y por qué U-Net cede el paso a los Transformers.
Una familia diferente
Todo lo que hemos visto hasta ahora describe Transformers que predicen el siguiente token. Es la arquitectura que domina el lenguaje, el código, y cada vez más el video y el audio.
Pero cuando escribes un prompt en Midjourney, Stable Diffusion o FLUX, no es eso lo que ocurre. La imagen no se genera píxel a píxel de izquierda a derecha. Aparece en todas partes a la vez, refinada por etapas sucesivas.
Es la obra de una familia de modelos muy distinta: los modelos de difusión.
La idea central: aprender a quitar ruido
El proceso de difusión se inspira en una intuición casi demasiado simple. Si tomo una imagen nítida y le añado progresivamente ruido gaussiano, en algún momento se vuelve indistinguible del ruido puro. Si aprendo a invertir ese proceso — a quitar ruido poco a poco — entonces puedo partir del ruido puro y terminar con una imagen nítida.
Durante el entrenamiento:
- Se toma una imagen del dataset
- Se le añade ruido según un calendario predefinido (por ejemplo T = 1000 etapas)
- Se entrena una red para predecir el ruido que se añadió, dada la imagen ruidosa y la etapa t
El modelo aprende así, para cualquier nivel de ruido, a reconocer lo que es "imagen real" y lo que es "ruido añadido".
En inferencia, se invierte: se parte del ruido puro, en cada paso el modelo predice el ruido, lo restamos, y repetimos. Después de T pasos, obtenemos una imagen plausible — que se parece a la distribución aprendida.
Prueba el debruidaje
Dos ajustes, un botón. Pon primero el número de etapas al mínimo y pulsa Generar; repite al máximo y compara. Después deja las etapas en paz y haz variar la guidance (CFG) de 0 a 15. Son exactamente los dos controles que te expone cualquier interfaz de generación de imágenes.
La animación parte de una imagen de ruido puro y la elimina paso a paso. Cada paso sigue el gradiente aprendido durante el entrenamiento, guiado por el embedding de texto de CLIP. A 5 pasos el resultado es borroso; a 50, es nítido.
Juega con el número de etapas. Con 5 pasos, la imagen sigue granulada — el modelo no tiene tiempo de refinar. Con 50 pasos, queda nítida pero a costa de diez veces más cómputo. La mayoría de los samplers modernos (DDIM, DPM-Solver) alcanzan una calidad casi óptima en 20 a 30 pasos.
Dirigir hacia una imagen concreta: la guidance
El ruido puro es el mismo para cualquier prompt. ¿Cómo sabe el modelo que queremos un atardecer y no un perro? La respuesta: condicionamos el modelo sobre el texto.
Durante el entrenamiento, además de la imagen ruidosa y la etapa, se proporciona a la red un embedding del texto asociado a la imagen (a menudo un encoder tipo CLIP). La red aprende así predicciones de ruido condicionadas: "sabiendo que la imagen describe un atardecer, así se ve el ruido".
En inferencia, se calculan dos predicciones: una con el prompt, otra sin (o con un prompt vacío). La técnica del Classifier-Free Guidance (CFG) consiste en extrapolar en la dirección del prompt:
prediccion_final = prediccion_sin_prompt + guidance × (prediccion_con_prompt − prediccion_sin_prompt)
El coeficiente guidance (CFG scale) controla cuánto nos alejamos de lo natural para pegarnos al prompt. Con CFG=0, el modelo ignora el texto; con CFG=7, la imagen sigue fielmente el prompt sin volverse artificial; más allá de 12, se vuelve sobresaturada y pierde sus detalles finos.
Latent diffusion: hacer menos cálculo
Una imagen 512×512 son 262 144 píxeles — y como cada uno lleva tres canales de color, 786 432 valores que procesar. Hacer 1 000 pasos de debruidaje sobre tantos píxeles es muy costoso. Stable Diffusion popularizó un truco: trabajar en un espacio latente comprimido.
Antes de entrenar el modelo de difusión, se entrena un autoencoder (un VAE) que comprime las imágenes en un espacio latente 64×64×4 — unas 48× más pequeño. La difusión se aplica entonces solo a ese latente, no a los píxeles. Al final del debruidaje, se decodifica el latente hacia la imagen final.
Eso es lo que hace que Stable Diffusion sea ejecutable en un GPU de consumo en pocos segundos — mientras que un modelo equivalente basado en píxeles necesitaría un cluster.
CLIP: el puente entre texto e imagen
Para condicionar sobre texto, hace falta una representación textual que comparta espacio con la de las imágenes. Ese es el papel de CLIP (Contrastive Language-Image Pretraining), entrenado por OpenAI sobre 400 millones de pares imagen/leyenda.
CLIP aprende dos encoders — uno para imágenes, otro para texto — que producen embeddings en un espacio común. Una leyenda y su imagen objetivo tienen embeddings cercanos; una leyenda no relacionada está lejos. Esa alineación permite al modelo de difusión entender prompts textuales que nunca ha visto exactamente durante el entrenamiento.
U-Net vs Transformer (DiT)
Durante mucho tiempo, la arquitectura de referencia para la difusión era la U-Net: una red convolucional en U, con skip connections que preservan los detalles finos. Stable Diffusion 1.4, 1.5 y 2 usan todas U-Nets.
Pero en 2022, Peebles y Xie propusieron DiT (Diffusion Transformer): reemplazar la U-Net por un Transformer puro. Cada "patch" de la imagen se trata como un token, con atención completa sobre todos los demás patches. Sin pirámide convolucional, sin skip connections — solo bloques Transformer apilados.
Stable Diffusion 3, FLUX, Sora (video) — todas las arquitecturas recientes han migrado al Transformer. ¿Por qué? Porque los Transformers escalan mejor: recuperamos las mismas scaling laws que para el lenguaje. Doblar el cómputo en un DiT mejora las imágenes de manera predecible.
El sampler: DDPM, DDIM, DPM-Solver
El sampler es el algoritmo que decide, en cada paso, cómo combinar la predicción del ruido con el estado actual para producir el siguiente paso.
| Sampler | Pasos típicos | Particularidad |
|---|---|---|
| DDPM | 1000 | Estocástico, fiel al entrenamiento, lento |
| DDIM | 20–50 | Determinista, calidad comparable a DDPM en muchos menos pasos |
| DPM-Solver | 10–25 | Solver de EDO, aún más rápido |
| Euler / Heun | 20–30 | Métodos clásicos de EDO, simples y robustos |
| LCM | 4–8 | Destilación latente, ultrarrápido |
La elección del sampler es una de las palancas más accesibles para ajustar velocidad vs calidad.
Por qué esta familia existe junto a los Transformers
Uno podría preguntar: ¿por qué no generar imágenes como generamos texto, token a token? La respuesta es sutil.
Para el texto, el orden es natural: leemos de izquierda a derecha, y cada palabra depende de las anteriores. Para una imagen, no hay orden canónico. Generar píxel a píxel introduce artefactos (los primeros píxeles no tienen el contexto de los últimos). La difusión resuelve este problema generando toda la imagen en paralelo, refinada globalmente en cada paso.
Por eso los enfoques autoregresivos sobre los píxeles (PixelRNN, el ImageGPT inicial de OpenAI) fueron abandonados: demasiado lentos, y el resultado llevaba la marca del orden de generación.
Pero la historia no acabó ahí, y es una bonita lección de humildad. Lo autoregresivo ha vuelto — ya no sobre píxeles, sino sobre tokens de imagen, exactamente como un LLM manipula tokens de texto. Cuando OpenAI integró la generación de imágenes directamente en sus modelos de lenguaje en 2025, el enfoque se puso a la cabeza de las comparativas, por delante de las mejores difusiones del momento. Desde entonces, la frontera mezcla las dos cosas: un transformer autoregresivo que decide qué representar, y un decodificador de tipo difusión que produce la imagen final.
La difusión no es un Transformer: es otra forma, matemáticamente ortogonal, de aprender una distribución compleja. Sigue dominando el open source para imagen — pero la idea de que "la difusión ha ganado" no ha durado. Las dos familias se están juntando.
Y es una buena forma de cerrar este recorrido. Partiste de un sistema que predice la siguiente palabra, y seguiste ese hilo hasta los tokens, los vectores, la atención, el alineamiento, los agentes, las features. Este último capítulo recuerda que existía otra ruta — y que acaba cruzándose con la primera. Nada de esto está estabilizado: las arquitecturas dominantes de hoy no serán forzosamente las de dentro de tres años. Pero los mecanismos que ahora conoces no van a moverse mucho. Son ellos los que te permitirán leer la próxima sorpresa por lo que es: una idea de ingeniería, no magia.
Actualizado el