Normalización por lotes
Técnica que normaliza las activaciones de una red usando estadísticas de un lote de entrenamiento y aprende una escala y un desplazamiento.
Explicado fácil
Durante el entrenamiento, las cantidades que circulan por una red pueden tomar escalas muy diferentes. La normalización por lotes las centra y ajusta su escala para que las capas reciban valores más manejables.
Una analogía
Es como ajustar el volumen de cada grupo de instrumentos antes de mezclarlos: todos quedan en un rango comparable y luego se puede recuperar el volumen que la mezcla necesite.
Un ejemplo
En una red convolucional para reconocer imágenes, se puede insertar una capa de normalización entre una convolución y una función de activación para estabilizar los valores que pasan a la siguiente capa.
Cómo funciona (nivel técnico)
En entrenamiento, para cada característica se calcula la media y varianza del lote actual; las activaciones se normalizan y se transforman con parámetros aprendibles de escala y desplazamiento. También se mantienen estimaciones de media y varianza que se utilizan durante la inferencia, cuando no se dispone de un lote de entrenamiento. La ubicación exacta y el comportamiento dependen de la arquitectura y del marco de trabajo.
Errores comunes
- Pensar que normaliza los datos originales: normalmente actúa sobre activaciones internas.
- Olvidar que el comportamiento en entrenamiento y en inferencia utiliza estadísticas distintas.
- Suponer que funciona igual de bien con cualquier tamaño de lote o arquitectura; en algunos modelos se prefieren otras normalizaciones, como LayerNorm.