Q-learning
Algoritmo de aprendizaje por refuerzo que estima el valor de cada acción en un estado para aprender una política sin conocer de antemano el modelo del entorno.
Explicado fácil
Q-learning ayuda a un agente a aprender qué acción conviene tomar en cada situación. Prueba acciones, recibe recompensas o penalizaciones y va guardando estimaciones de qué tan conveniente resulta cada una a largo plazo.
Una analogía
Es como aprender rutas en una ciudad nueva: recuerdas qué calles te acercaron al destino y cuáles te hicieron perder tiempo, y con la experiencia eliges mejores caminos.
Un ejemplo
En un laberinto, el agente puede recibir una recompensa al llegar a la salida y una pequeña penalización por cada paso. Q-learning actualiza sus estimaciones después de cada movimiento para que las rutas que llevan a la salida ganen valor.
Cómo funciona (nivel técnico)
El algoritmo mantiene una tabla o aproximador Q(s, a) para estimar el retorno futuro de ejecutar la acción a en el estado s. Una actualización tabular típica suma a Q(s, a) una fracción del error entre la estimación actual y el objetivo r + gamma * max_a' Q(s', a'), donde r es la recompensa, s' el siguiente estado, gamma el descuento y alpha la tasa de aprendizaje. En estados terminales no se añade valor futuro. La política de comportamiento puede explorar acciones distintas de la que actualmente parece mejor.
Errores comunes
- Creer que Q-learning requiere conocer las transiciones del entorno; precisamente aprende a partir de la interacción.
- Confundir la tabla Q con una política: la política se obtiene eligiendo acciones según sus valores, con una estrategia de exploración.
- Suponer que una tabla es viable en espacios grandes o continuos; allí se necesitan aproximadores y aparecen retos de estabilidad.