LoRA
Método de ajuste fino que, en lugar de modificar todo el modelo, entrena solo unas pequeñas matrices añadidas, lo que ahorra memoria, tiempo y dinero.
Explicado fácil
Reentrenar un modelo gigante entero cuesta una fortuna. LoRA congela el modelo original y añade encima unas piezas pequeñas y entrenables. Solo se ajustan esas piezas, que suelen representar menos del 1 % del tamaño total.
Una analogía
En lugar de reescribir un libro entero, pegas notas adhesivas en los márgenes con las correcciones. El libro original queda intacto, y puedes quitar o cambiar las notas según el uso.
Un ejemplo
Una empresa quiere que un modelo escriba con su estilo de comunicación. Entrena un adaptador LoRA de unos pocos megabytes y lo “enchufa” al modelo base; para otro cliente enchufa un adaptador distinto, sin duplicar el modelo.
Cómo funciona (nivel técnico)
En una capa con matriz de pesos W de tamaño d×k, LoRA no cambia W sino que aprende una actualización de rango bajo ΔW = B·A, con B de d×r y A de r×k, donde r es muy pequeño (por ejemplo, 8 o 16). Solo se entrenan A y B, de modo que el número de parámetros entrenables se reduce en varios órdenes de magnitud. Tras el entrenamiento, ΔW puede fusionarse con W sin coste extra en la inferencia. QLoRA combina LoRA con un modelo base cuantizado a 4 bits, lo que permite afinar modelos grandes en una sola GPU.
Errores comunes
- Creer que logra siempre la misma calidad que el ajuste completo. Normalmente se acerca, pero no en todas las tareas.
- Olvidar que el adaptador depende del modelo base concreto con el que se entrenó.