Codificación posicional
Información que se incorpora a las representaciones de una secuencia para que un transformer pueda distinguir el orden o la posición de sus elementos.
Explicado fácil
La atención puede relacionar elementos de una secuencia, pero necesita información sobre dónde aparecen para distinguir «el perro persigue al gato» de «el gato persigue al perro». La codificación posicional aporta esa señal de orden.
Una analogía
Es como numerar las líneas de una receta: los ingredientes y las instrucciones no bastan si no sabes en qué orden seguirlas.
Un ejemplo
Al procesar una frase, el modelo combina la representación de cada token con información de su posición para que las relaciones entre palabras tengan en cuenta el orden.
Cómo funciona (nivel técnico)
El transformer original sumaba a las representaciones de entrada codificaciones sinusoidales de posición. Otras arquitecturas usan vectores posicionales aprendidos o incorporan la posición de otra forma, por ejemplo en los puntajes de atención. El método influye en cómo el modelo trata secuencias más largas o posiciones no vistas durante el entrenamiento.
Errores comunes
- Creer que todas las arquitecturas transformer usan la misma codificación.
- Confundir la posición del token con su significado: son señales diferentes que el modelo combina.
- Suponer que una codificación concreta garantiza extrapolar a cualquier longitud de contexto.