Saltar al contenido

RLHF

Nivel avanzado Revisado el 6 de octubre de 2026

Aprendizaje por refuerzo con retroalimentación humana: técnica que ajusta un modelo según las preferencias de personas para que sus respuestas sean más útiles y seguras.

Explicado fácil

Un modelo recién preentrenado sabe mucho, pero no sabe comportarse: puede divagar, ser ofensivo o ignorar lo que le piden. El RLHF lo pule mostrándole qué respuestas prefieren las personas.

Una analogía

Es como un cocinero que prueba cientos de platos y, tras cada servicio, un panel de comensales le dice cuál prefiere de dos opciones. Poco a poco aprende no solo a cocinar, sino a cocinar lo que a la gente le gusta.

Un ejemplo

Se le plantea al modelo una pregunta y genera dos respuestas, A y B. Una persona indica cuál es mejor. Con miles de comparaciones así, el modelo aprende a preferir respuestas claras, honestas y seguras.

Cómo funciona (nivel técnico)

Hay tres etapas. (1) Fine-tuning supervisado con ejemplos de buenas respuestas. (2) Entrenamiento de un modelo de recompensa que predice las preferencias humanas a partir de comparaciones. (3) Optimización del modelo de lenguaje con aprendizaje por refuerzo (por ejemplo, PPO) para maximizar esa recompensa sin alejarse demasiado del modelo original. Existen alternativas, como la DPO (optimización directa de preferencias), que evita el paso de refuerzo, y enfoques en los que las preferencias las genera otro modelo siguiendo unos principios escritos (IA constitucional).

Errores comunes

  • Creer que hace al modelo “bueno” en un sentido moral. Optimiza lo que los evaluadores prefieren, con sus sesgos.
  • Ignorar la adulación (sycophancy): los modelos pueden aprender a decirte lo que quieres oír porque eso suele puntuar bien.