Saltar al contenido

Embedding

Nivel intermedio Revisado el 6 de octubre de 2026

Representación de una palabra, frase, imagen u otro dato como una lista de números, de forma que los elementos con significado parecido quedan cerca entre sí.

Explicado fácil

Para un ordenador, “perro” y “can” son cadenas de letras sin relación. Un embedding las convierte en coordenadas dentro de un “mapa del significado”, donde las palabras parecidas quedan cerca. En ese mapa, “perro” estará junto a “can” y “cachorro”, y lejos de “nube”.

Una analogía

Es como situar ciudades con latitud y longitud. Dos ciudades con coordenadas cercanas están próximas en el mundo. Aquí las “coordenadas” son cientos o miles de números y la “cercanía” es de significado, no geográfica.

Un ejemplo

Un buscador semántico convierte tu pregunta “cómo arreglar un grifo que gotea” en un embedding y encuentra los documentos cuyo embedding está más cerca, aunque no usen exactamente esas palabras (“reparar una fuga en la llave del agua”).

Cómo funciona (nivel técnico)

Un embedding es un vector de dimensión fija (por ejemplo, de 768 a 3072 números). Se obtiene como resultado de un modelo entrenado para que entradas con significado similar produzcan vectores cercanos. La cercanía se mide con la similitud del coseno o el producto escalar. Famosamente, en los embeddings de word2vec se observaban relaciones como rey − hombre + mujer ≈ reina. Son la base de la búsqueda semántica, la recomendación y el RAG, y se almacenan en bases de datos vectoriales.

Errores comunes

  • Pensar que cada número del vector tiene un significado legible. Solo el conjunto es interpretable.
  • Mezclar embeddings de modelos distintos: viven en espacios diferentes y no son comparables.