Saltar al contenido

Aprendizaje por refuerzo

Nivel intermedio Revisado el 6 de octubre de 2026

Tipo de aprendizaje automático en el que un agente aprende por ensayo y error, recibiendo recompensas cuando actúa bien y penalizaciones cuando actúa mal.

Explicado fácil

No hay respuestas correctas de antemano. Un agente prueba acciones en un entorno, observa qué pasa y recibe una puntuación (recompensa). Con el tiempo aprende qué acciones conducen a más recompensa acumulada.

Una analogía

Es enseñar trucos a un perro con premios. No le explicas qué es “sentarse”; le das una golosina cuando, por casualidad o por guía, hace algo parecido, y poco a poco asocia la acción con el premio.

Un ejemplo

AlphaGo, el sistema de DeepMind que venció a campeones de Go, mejoró jugando millones de partidas contra sí mismo y aprendiendo de si ganaba o perdía.

Cómo funciona (nivel técnico)

Se formaliza como un proceso de decisión de Markov: en cada paso el agente observa un estado, elige una acción según su política, recibe una recompensa y pasa a un nuevo estado. El objetivo es maximizar la recompensa acumulada esperada. Hay un dilema central entre explotar lo que ya sabe y explorar acciones nuevas. Una variante muy relevante hoy es el RLHF, que usa preferencias humanas como señal de recompensa para pulir modelos de lenguaje.

Errores comunes

  • Diseñar mal la recompensa. Los agentes encuentran atajos inesperados (“hackeo de recompensa”) que maximizan la puntuación sin hacer lo que querías.
  • Pensar que es la técnica detrás de todos los modelos actuales. Solo interviene en ciertas fases del entrenamiento.