Hiperparámetros
Ajustes que decide una persona antes de entrenar un modelo, como la velocidad de aprendizaje o el tamaño de la red, y que no se aprenden de los datos.
Explicado fácil
Si los parámetros son lo que el modelo aprende, los hiperparámetros son las reglas del entrenamiento: cuánto se tarda, cómo de grandes son los pasos o cuántas capas tiene la red. Los elige la persona que entrena el modelo.
Una analogía
Al hornear un pastel, los ingredientes que se transforman son los parámetros; la temperatura del horno y el tiempo son los hiperparámetros. No cambian durante la cocción, pero determinan el resultado.
Un ejemplo
Entrenar dos veces el mismo modelo con la misma información, una con un paso de aprendizaje pequeño y otra con uno grande, puede dar un modelo excelente y otro que ni siquiera converge.
Cómo funciona (nivel técnico)
Los más habituales son la tasa de aprendizaje, el tamaño del lote, el número de épocas, la arquitectura (capas, anchura), la fuerza de la regularización y el dropout. Se eligen probando: búsqueda en rejilla, búsqueda aleatoria u optimización bayesiana, siempre evaluando sobre el conjunto de validación y nunca sobre el de prueba. En modelos grandes, cada prueba es tan cara que se recurre a leyes de escalado para extrapolar desde experimentos pequeños.
Errores comunes
- Ajustar los hiperparámetros mirando el conjunto de prueba, lo que contamina la evaluación final.
- Confundirlos con los parámetros del modelo.
- Atribuir al algoritmo un mal resultado que en realidad se debía a una mala configuración.