Adaptar y optimizar modelos
Cómo se ajustan, comprimen y hacen más baratos los modelos.
- Cuantización
Técnica que reduce el tamaño y el coste de un modelo guardando sus parámetros con menos precisión numérica, con una pérdida de calidad pequeña.
- Destilación
Técnica en la que un modelo pequeño (el alumno) aprende a imitar a uno grande (el maestro) para ofrecer un rendimiento parecido con mucho menos coste.
- Fine-tuning
Reentrenar un modelo ya entrenado con un conjunto de datos más pequeño y específico para que se especialice en una tarea, un estilo o un dominio.
- Inferencia
Uso de un modelo ya entrenado para producir una respuesta o predicción a partir de una entrada nueva.
- LoRA
Método de ajuste fino que, en lugar de modificar todo el modelo, entrena solo unas pequeñas matrices añadidas, lo que ahorra memoria, tiempo y dinero.
- Mezcla de expertos
Arquitectura en la que un modelo se compone de muchos bloques especializados y, para cada token, solo se activan unos pocos, de modo que es grande pero barato de ejecutar.