Razonamiento en cadena
Técnica en la que el modelo escribe los pasos intermedios de un problema antes de dar la respuesta final, lo que mejora su acierto en tareas complejas.
Explicado fácil
Los modelos de lenguaje responden mejor a los problemas difíciles si “piensan en voz alta”. En lugar de saltar directamente a la solución, escriben el proceso paso a paso y luego dan la respuesta.
Una analogía
Es la diferencia entre calcular una multiplicación larga de cabeza y hacerla en un papel. Si escribes los pasos intermedios, es mucho menos probable que te equivoques.
Un ejemplo
Pregunta: “Una tienda tiene 23 manzanas, vende 9 y recibe 2 cajas de 12. ¿Cuántas tiene?”. Un modelo que razona escribe: 23 − 9 = 14; 2 × 12 = 24; 14 + 24 = 38. Y concluye: 38.
Cómo funciona (nivel técnico)
Se descubrió que bastaba con incluir ejemplos con razonamiento paso a paso en el prompt, o incluso con pedir “piensa paso a paso”, para mejorar el rendimiento. Hoy existen modelos de razonamiento entrenados específicamente para generar largas cadenas de pensamiento antes de responder, normalmente con aprendizaje por refuerzo que premia las respuestas correctas. Esto dedica más cómputo en el momento de la inferencia (test-time compute): más “tokens de pensamiento”, mejor resultado, a costa de más tiempo y precio.
Errores comunes
- Asumir que el razonamiento escrito refleja fielmente el proceso interno del modelo. Puede no hacerlo, y es un tema de investigación activo.
- Usarlo para tareas simples, donde solo añade lentitud y coste.
- Creer que un razonamiento largo implica un resultado correcto: puede ser coherente y estar equivocado.