Descenso del gradiente
Método para entrenar modelos que ajusta los parámetros paso a paso en la dirección que más reduce el error.
Explicado fácil
Imagina que estás en una montaña con niebla y quieres llegar al valle. No ves el mapa, pero sientes hacia dónde baja el suelo bajo tus pies. Das un paso en esa dirección, vuelves a notar la pendiente y repites. Eso es el descenso del gradiente.
Una analogía
La “montaña” es la función de pérdida: cada posición corresponde a una combinación de parámetros y la altura es el error. Bajar es mejorar el modelo.
Un ejemplo
Con un solo parámetro, imagina una curva en forma de U. Empiezas en un punto cualquiera, calculas hacia dónde baja la curva y avanzas un poco. Tras varios pasos llegas al fondo de la U.
Cómo funciona (nivel técnico)
En cada iteración se actualizan los parámetros así: nuevo = actual - tasa_de_aprendizaje × gradiente. El gradiente es el vector de derivadas parciales de la pérdida y se obtiene con retropropagación. En la práctica se usa la variante estocástica por lotes (SGD), que estima el gradiente con un pequeño subconjunto de datos, y optimizadores como Adam, que adaptan el paso para cada parámetro. La tasa de aprendizaje es el hiperparámetro más delicado: demasiado alta y el modelo “salta” sin converger, demasiado baja y tarda una eternidad.
Errores comunes
- Creer que siempre encuentra el mejor punto posible. Puede quedarse en mínimos locales o en zonas planas, aunque en redes grandes esto suele importar menos de lo esperado.
- Usar una tasa de aprendizaje inadecuada.