Saltar al contenido

RAG

Nivel intermedio Revisado el 6 de octubre de 2026

Generación aumentada por recuperación: técnica en la que el modelo busca primero documentos relevantes y luego responde apoyándose en ellos.

Explicado fácil

Un modelo de lenguaje solo sabe lo que aprendió durante su entrenamiento, y eso incluye lagunas y cosas desactualizadas. Con RAG, antes de responder se busca información en una fuente fiable (tus documentos, una web, una base de datos) y se le entrega al modelo para que conteste con ella delante.

Una analogía

Es la diferencia entre un examen de memoria y un examen “a libro abierto”. El estudiante (el modelo) no necesita saberse todo: consulta el manual y redacta la respuesta basándose en lo que encuentra.

Un ejemplo

Un asistente de atención al cliente de una aseguradora responde preguntas sobre la póliza de cada usuario. No “recuerda” las pólizas: busca el documento correspondiente y lo usa para contestar, citando el apartado.

Cómo funciona (nivel técnico)

El proceso típico es: (1) indexación: se trocean los documentos y se calculan sus embeddings, que se guardan en una base de datos vectorial; (2) recuperación: la pregunta del usuario también se convierte en un embedding y se buscan los fragmentos más cercanos; (3) generación: esos fragmentos se insertan en el prompt y el modelo redacta la respuesta. Mejoras habituales: búsqueda híbrida (semántica más palabras clave), reordenación de resultados y evaluación de la calidad de recuperación.

Errores comunes

  • Creer que RAG elimina las alucinaciones. Las reduce, pero si la recuperación falla o el modelo ignora el contexto, siguen apareciendo.
  • Trocear mal los documentos: fragmentos demasiado pequeños pierden sentido, y demasiado grandes meten ruido.
  • Usar fine-tuning cuando el problema real era dar acceso a información cambiante.