Cuantización
Técnica que reduce el tamaño y el coste de un modelo guardando sus parámetros con menos precisión numérica, con una pérdida de calidad pequeña.
Explicado fácil
Un modelo es una enorme lista de números con muchos decimales. La cuantización los redondea para que ocupen menos espacio, igual que guardar una foto con menos colores pesa menos y, aun así, se ve bien.
Una analogía
Es como pasar de medir una distancia con precisión de milímetros a hacerlo en centímetros. Casi siempre te basta, y las mediciones son más rápidas y baratas de almacenar.
Un ejemplo
Un modelo que en su formato original necesita 140 GB de memoria puede quedar en unos 35 GB al cuantizarlo a 4 bits, lo suficiente para ejecutarlo en un equipo con hardware mucho más modesto.
Cómo funciona (nivel técnico)
Los parámetros suelen almacenarse en 16 bits (FP16 o BF16). La cuantización los convierte a enteros de 8, 4 o incluso menos bits, guardando factores de escala para reconstruir los valores aproximados. Puede aplicarse tras el entrenamiento (post-training quantization) o durante él (quantization-aware training). Reduce el uso de memoria y acelera la inferencia, que suele estar limitada por el ancho de banda de memoria. El coste es una ligera pérdida de calidad que crece al bajar de bits y que suele notarse más en tareas de razonamiento precisas.
Errores comunes
- Pensar que cuantizar no pierde nada: hay pérdida, pequeña con 8 bits y mayor con 3 o 2.
- Comparar modelos cuantizados distintos sin comprobar el método usado, que influye mucho en la calidad.