Saltar al contenido

Mecanismo de atención

Nivel avanzado Revisado el 6 de octubre de 2026

Técnica que permite a un modelo decidir qué partes de la información de entrada son más relevantes para cada parte de la salida.

Explicado fácil

Cuando lees una frase larga, no dedicas la misma atención a todas las palabras: te fijas en las que importan para entender la que estás leyendo. El mecanismo de atención da a los modelos esa capacidad de “fijarse” en lo relevante.

Una analogía

Es como subrayar un texto con un rotulador que cambia de intensidad. Para cada palabra, el modelo subraya con más fuerza las otras palabras que le ayudan a interpretarla.

Un ejemplo

En “Ana le dijo a Marta que ella ganó el premio”, el modelo debe decidir si “ella” es Ana o Marta. La atención asigna más peso a una u otra según el contexto que rodea a la frase.

Cómo funciona (nivel técnico)

Cada token genera tres vectores: consulta (query), clave (key) y valor (value). La relevancia entre dos tokens se calcula como el producto de la consulta de uno por la clave del otro; tras normalizarse con softmax, esos pesos mezclan los valores. Con atención multicabeza, el proceso se repite en paralelo varias veces, y cada cabeza puede especializarse en un tipo de relación. En los modelos generativos se aplica una máscara causal para que cada token solo mire hacia atrás. Variantes como FlashAttention reducen el coste de memoria.

Errores comunes

  • Interpretar los pesos de atención como una explicación fiable de por qué el modelo respondió algo. Son una pista, no una prueba.
  • Pensar que la atención es lo mismo que “comprender”.