Inferencia
Uso de un modelo ya entrenado para producir una respuesta o predicción a partir de una entrada nueva.
Explicado fácil
La inferencia es el momento en que usas el modelo. Cuando escribes una pregunta a un asistente y recibe una respuesta, eso es inferencia. No se aprende nada nuevo: el modelo aplica lo que ya sabe.
Una analogía
Entrenar es estudiar para el examen; la inferencia es hacer el examen. Estudiar es largo y caro; contestar cada pregunta es más rápido, pero ocurre millones de veces.
Un ejemplo
Cada vez que una app traduce una frase, un modelo ya entrenado recibe el texto, lo procesa y devuelve la traducción. Eso se llama una “llamada de inferencia”.
Cómo funciona (nivel técnico)
En un modelo de lenguaje, la inferencia es autorregresiva: el modelo calcula una distribución de probabilidad sobre el siguiente token, se elige uno (según la temperatura), se añade a la secuencia y se repite. Se divide en una fase de lectura de la entrada (prefill, paralelizable) y una de generación (decode, secuencial y limitada por la memoria). Reducir el coste de inferencia es hoy un área clave, con técnicas como la cuantización, la caché de claves y valores o la destilación.
Errores comunes
- Pensar que inferencia es “razonar”. En este contexto es solo ejecutar el modelo.
- Subestimar su coste: aunque cada consulta sea barata, a gran escala la inferencia suele superar al coste del entrenamiento.