Saltar al contenido

LoRA

Nivel avanzado Revisado el 6 de octubre de 2026

Método de ajuste fino que, en lugar de modificar todo el modelo, entrena solo unas pequeñas matrices añadidas, lo que ahorra memoria, tiempo y dinero.

Explicado fácil

Reentrenar un modelo gigante entero cuesta una fortuna. LoRA congela el modelo original y añade encima unas piezas pequeñas y entrenables. Solo se ajustan esas piezas, que suelen representar menos del 1 % del tamaño total.

Una analogía

En lugar de reescribir un libro entero, pegas notas adhesivas en los márgenes con las correcciones. El libro original queda intacto, y puedes quitar o cambiar las notas según el uso.

Un ejemplo

Una empresa quiere que un modelo escriba con su estilo de comunicación. Entrena un adaptador LoRA de unos pocos megabytes y lo “enchufa” al modelo base; para otro cliente enchufa un adaptador distinto, sin duplicar el modelo.

Cómo funciona (nivel técnico)

En una capa con matriz de pesos W de tamaño d×k, LoRA no cambia W sino que aprende una actualización de rango bajo ΔW = B·A, con B de d×r y A de r×k, donde r es muy pequeño (por ejemplo, 8 o 16). Solo se entrenan A y B, de modo que el número de parámetros entrenables se reduce en varios órdenes de magnitud. Tras el entrenamiento, ΔW puede fusionarse con W sin coste extra en la inferencia. QLoRA combina LoRA con un modelo base cuantizado a 4 bits, lo que permite afinar modelos grandes en una sola GPU.

Errores comunes

  • Creer que logra siempre la misma calidad que el ajuste completo. Normalmente se acerca, pero no en todas las tareas.
  • Olvidar que el adaptador depende del modelo base concreto con el que se entrenó.