Saltar al contenido

Inferencia

Nivel básico Revisado el 6 de octubre de 2026

Uso de un modelo ya entrenado para producir una respuesta o predicción a partir de una entrada nueva.

Explicado fácil

La inferencia es el momento en que usas el modelo. Cuando escribes una pregunta a un asistente y recibe una respuesta, eso es inferencia. No se aprende nada nuevo: el modelo aplica lo que ya sabe.

Una analogía

Entrenar es estudiar para el examen; la inferencia es hacer el examen. Estudiar es largo y caro; contestar cada pregunta es más rápido, pero ocurre millones de veces.

Un ejemplo

Cada vez que una app traduce una frase, un modelo ya entrenado recibe el texto, lo procesa y devuelve la traducción. Eso se llama una “llamada de inferencia”.

Cómo funciona (nivel técnico)

En un modelo de lenguaje, la inferencia es autorregresiva: el modelo calcula una distribución de probabilidad sobre el siguiente token, se elige uno (según la temperatura), se añade a la secuencia y se repite. Se divide en una fase de lectura de la entrada (prefill, paralelizable) y una de generación (decode, secuencial y limitada por la memoria). Reducir el coste de inferencia es hoy un área clave, con técnicas como la cuantización, la caché de claves y valores o la destilación.

Errores comunes

  • Pensar que inferencia es “razonar”. En este contexto es solo ejecutar el modelo.
  • Subestimar su coste: aunque cada consulta sea barata, a gran escala la inferencia suele superar al coste del entrenamiento.