U-Net
Arquitectura de red neuronal con una ruta de compresión y otra de expansión, conectadas por atajos, muy utilizada para segmentar imágenes.
Explicado fácil
U-Net es una arquitectura que reduce una imagen para captar su contexto y después recupera resolución para producir una predicción detallada píxel a píxel. Sus conexiones entre niveles ayudan a conservar información espacial fina.
Una analogía
Es como mirar primero un mapa desde lejos para entender el barrio y después acercarse, conservando anotaciones de cada nivel, para marcar con precisión una calle concreta.
Un ejemplo
En una imagen médica, U-Net puede asignar a cada píxel una etiqueta como «tejido» o «fondo», delimitando una estructura que se quiere medir.
Cómo funciona (nivel técnico)
La ruta descendente aplica convoluciones y reducción espacial para extraer características cada vez más amplias. La ruta ascendente aumenta la resolución y combina sus activaciones con características de la ruta descendente mediante conexiones de salto. La arquitectura original se diseñó para segmentación biomédica; variantes de U-Net también se utilizan como red de eliminación de ruido en algunos modelos de difusión.
Errores comunes
- Creer que U-Net es un algoritmo de entrenamiento o un modelo generativo por sí mismo: es una arquitectura.
- Suponer que solo se usa en medicina o que todos los modelos de difusión la incorporan.
- Confundir la segmentación, que etiqueta regiones o píxeles, con la clasificación de una imagen completa.