Token
Fragmento de texto (una palabra, parte de una palabra o un signo) en el que un modelo de lenguaje divide lo que lee y escribe.
Explicado fácil
Los modelos de lenguaje no leen letras ni palabras completas, sino “tokens”: trozos de texto. Una palabra corta y frecuente suele ser un solo token; una larga o rara se parte en varios.
Una analogía
Son las piezas de un Lego lingüístico. Con un número limitado de piezas (unas decenas de miles) se puede construir cualquier texto, igual que con pocas piezas de Lego se construye casi cualquier cosa.
Un ejemplo
La palabra “casa” puede ser un único token, mientras que “anticonstitucionalmente” puede partirse en cuatro o cinco. En español suele hacer falta algo más de un token por palabra, algo más que en inglés, porque los tokenizadores se diseñaron sobre todo con textos en inglés.
Cómo funciona (nivel técnico)
Un tokenizador se construye antes del entrenamiento con algoritmos como Byte-Pair Encoding, que fusiona repetidamente los pares de símbolos más frecuentes del corpus. Cada token tiene un número de identificación, y ese número se convierte después en un embedding. Los tokens importan porque el tamaño de la ventana de contexto, la velocidad y el precio de los servicios de IA se miden en tokens. También explican fallos curiosos, como que los modelos tengan problemas para contar letras dentro de una palabra: nunca la ven letra a letra.
Errores comunes
- Creer que un token es una palabra o un carácter.
- Calcular costes o límites pensando en palabras: un texto en español consume más tokens de los que parece.