Parámetros
Los números internos de un modelo (sus pesos) que se ajustan durante el entrenamiento y que contienen todo lo que ha aprendido.
Explicado fácil
Los parámetros son los “botones” internos de un modelo. Al principio tienen valores casi aleatorios; durante el entrenamiento se van moviendo hasta que el modelo funciona bien. Cuando oyes que un modelo tiene “70 000 millones de parámetros”, se refiere a cuántos de estos botones tiene.
Una analogía
Son las conexiones entre neuronas en un cerebro: cada una guarda un trocito minúsculo de lo aprendido, y solo el conjunto produce comportamiento inteligente.
Un ejemplo
Un modelo muy pequeño que predice si un correo es spam puede tener unos miles de parámetros. GPT-3 tenía 175 000 millones. Cada uno de ellos es un número decimal que ocupa 2 o 4 bytes, de ahí que los modelos grandes pesen cientos de gigabytes.
Cómo funciona (nivel técnico)
En una red densa, los parámetros son sobre todo las matrices de pesos de cada capa. Más parámetros dan más capacidad de aprender, pero también más coste de entrenamiento y de inferencia. Las leyes de escalado muestran que el rendimiento mejora de forma predecible al aumentar a la vez parámetros, datos y computación. En los modelos de mezcla de expertos hay que distinguir parámetros totales de parámetros activos por cada token procesado.
Errores comunes
- Creer que más parámetros equivale siempre a mejor modelo. Importan también los datos, el entrenamiento y la arquitectura.
- Confundir parámetros con hiperparámetros: los primeros se aprenden; los segundos los fija una persona.