Saltar al contenido

Q-learning

Nivel avanzado Revisado el 6 de octubre de 2026

Algoritmo de aprendizaje por refuerzo que estima el valor de cada acción en un estado para aprender una política sin conocer de antemano el modelo del entorno.

Explicado fácil

Q-learning ayuda a un agente a aprender qué acción conviene tomar en cada situación. Prueba acciones, recibe recompensas o penalizaciones y va guardando estimaciones de qué tan conveniente resulta cada una a largo plazo.

Una analogía

Es como aprender rutas en una ciudad nueva: recuerdas qué calles te acercaron al destino y cuáles te hicieron perder tiempo, y con la experiencia eliges mejores caminos.

Un ejemplo

En un laberinto, el agente puede recibir una recompensa al llegar a la salida y una pequeña penalización por cada paso. Q-learning actualiza sus estimaciones después de cada movimiento para que las rutas que llevan a la salida ganen valor.

Cómo funciona (nivel técnico)

El algoritmo mantiene una tabla o aproximador Q(s, a) para estimar el retorno futuro de ejecutar la acción a en el estado s. Una actualización tabular típica suma a Q(s, a) una fracción del error entre la estimación actual y el objetivo r + gamma * max_a' Q(s', a'), donde r es la recompensa, s' el siguiente estado, gamma el descuento y alpha la tasa de aprendizaje. En estados terminales no se añade valor futuro. La política de comportamiento puede explorar acciones distintas de la que actualmente parece mejor.

Errores comunes

  • Creer que Q-learning requiere conocer las transiciones del entorno; precisamente aprende a partir de la interacción.
  • Confundir la tabla Q con una política: la política se obtiene eligiendo acciones según sus valores, con una estrategia de exploración.
  • Suponer que una tabla es viable en espacios grandes o continuos; allí se necesitan aproximadores y aparecen retos de estabilidad.