Transformer
Arquitectura de red neuronal basada en el mecanismo de atención que es la base de casi todos los modelos de lenguaje actuales.
Explicado fácil
El transformer es el diseño de red neuronal que lo cambió todo. Su idea clave es que, para entender una palabra, el modelo puede mirar todas las demás palabras de la frase a la vez y decidir en cuáles fijarse. Antes, las redes leían el texto palabra por palabra, en orden, y se les olvidaba el principio de las frases largas.
Una analogía
Antes, leer era como seguir una frase con el dedo, palabra por palabra. Un transformer es como tener la página completa ante los ojos y poder señalar a la vez qué palabras se relacionan con cuáles.
Un ejemplo
En “El trofeo no cabe en la maleta porque es demasiado grande”, la palabra “es” se refiere al trofeo. Un transformer puede conectar ambas aunque estén separadas.
Cómo funciona (nivel técnico)
Presentado por investigadores de Google en 2017, un transformer apila bloques que combinan autoatención de varias cabezas, una red densa por posición, conexiones residuales y normalización. Como procesa todos los tokens en paralelo, aprovecha mucho mejor las GPU que las redes recurrentes. Como no tiene noción de orden por sí mismo, se le añaden codificaciones posicionales. Los modelos de lenguaje actuales usan la variante “solo decodificador”: predicen el siguiente token mirando solo los anteriores. También se usa en imágenes (Vision Transformer), audio y vídeo.
Errores comunes
- Confundirlo con un modelo concreto. Transformer es una arquitectura; GPT, Claude o Gemini son modelos construidos sobre variantes de ella.
- Creer que no tiene límites: el coste de la atención crece de forma cuadrática con la longitud del texto.