Saltar al contenido

Descenso del gradiente

Nivel intermedio Revisado el 6 de octubre de 2026

Método para entrenar modelos que ajusta los parámetros paso a paso en la dirección que más reduce el error.

Explicado fácil

Imagina que estás en una montaña con niebla y quieres llegar al valle. No ves el mapa, pero sientes hacia dónde baja el suelo bajo tus pies. Das un paso en esa dirección, vuelves a notar la pendiente y repites. Eso es el descenso del gradiente.

Una analogía

La “montaña” es la función de pérdida: cada posición corresponde a una combinación de parámetros y la altura es el error. Bajar es mejorar el modelo.

Un ejemplo

Con un solo parámetro, imagina una curva en forma de U. Empiezas en un punto cualquiera, calculas hacia dónde baja la curva y avanzas un poco. Tras varios pasos llegas al fondo de la U.

Cómo funciona (nivel técnico)

En cada iteración se actualizan los parámetros así: nuevo = actual - tasa_de_aprendizaje × gradiente. El gradiente es el vector de derivadas parciales de la pérdida y se obtiene con retropropagación. En la práctica se usa la variante estocástica por lotes (SGD), que estima el gradiente con un pequeño subconjunto de datos, y optimizadores como Adam, que adaptan el paso para cada parámetro. La tasa de aprendizaje es el hiperparámetro más delicado: demasiado alta y el modelo “salta” sin converger, demasiado baja y tarda una eternidad.

Errores comunes

  • Creer que siempre encuentra el mejor punto posible. Puede quedarse en mínimos locales o en zonas planas, aunque en redes grandes esto suele importar menos de lo esperado.
  • Usar una tasa de aprendizaje inadecuada.