Fragmentación de documentos
División de documentos extensos en fragmentos más pequeños para indexarlos, recuperarlos y suministrarlos como contexto a un modelo.
Explicado fácil
Para que un sistema RAG pueda encontrar información dentro de documentos largos, suele dividirlos en fragmentos. Después puede recuperar las partes que parecen más útiles para responder una pregunta.
Una analogía
Es como poner separadores en un libro de consulta: si cada sección es demasiado larga cuesta encontrar el dato; si se corta en frases sueltas, se pierde el contexto.
Un ejemplo
Un manual de producto puede dividirse por encabezados y párrafos en fragmentos con metadatos de capítulo. Cuando alguien pregunta cómo reiniciar un dispositivo, el sistema busca y entrega las secciones pertinentes al modelo.
Cómo funciona (nivel técnico)
La estrategia puede usar longitud máxima, separadores semánticos o la estructura del documento. A veces se solapan fragmentos vecinos para conservar continuidad. El tamaño, solapamiento, metadatos y modelo de embedding afectan la recuperación, el coste y cuánto contexto cabe en cada consulta.
Errores comunes
- Usar un tamaño fijo que corta tablas, código, listas o ideas a mitad.
- Hacer fragmentos muy grandes, que añaden información irrelevante, o demasiado pequeños, que pierden el significado.
- Evaluar el sistema solo por la calidad de redacción y no comprobar qué fragmentos recuperó.