Saltar al contenido

Modelo de difusión

Nivel avanzado Revisado el 6 de octubre de 2026

Modelo generativo que aprende a crear imágenes, audio o vídeo partiendo de ruido aleatorio y eliminándolo poco a poco hasta obtener un resultado nítido.

Explicado fácil

Imagina una foto a la que añades “nieve” de televisión poco a poco hasta que solo queda ruido. Un modelo de difusión aprende el proceso inverso: dada una pantalla de ruido, va quitando nieve paso a paso hasta que aparece una imagen coherente.

Una analogía

Es como un escultor que ve un bloque de piedra informe y va retirando material hasta revelar la figura. En cada paso, el modelo “adivina” qué ruido sobra.

Un ejemplo

Escribes “un faro al amanecer, pintura al óleo”. El generador parte de ruido aleatorio y, guiado por tu descripción, lo va refinando en unas decenas de pasos hasta formar la imagen.

Cómo funciona (nivel técnico)

El entrenamiento tiene dos procesos. En el proceso directo se añade ruido gaussiano a imágenes reales en muchos pasos. Una red (normalmente tipo U-Net o un transformer) aprende a predecir el ruido añadido en cada paso. Al generar, se invierte el proceso: se parte de ruido puro y se resta el ruido predicho de forma iterativa. El texto guía la generación mediante embeddings de la descripción (guía classifier-free). Muchos sistemas trabajan en un espacio latente comprimido para ser más eficientes (latent diffusion).

Errores comunes

  • Creer que el modelo “recorta y pega” imágenes existentes. Genera píxeles nuevos, aunque puede reproducir rasgos de su entrenamiento.
  • Esperar precisión absoluta con texto dentro de imágenes o con manos y detalles finos: es un punto débil habitual.