Saltar al contenido

Conjunto de datos

Nivel básico Revisado el 6 de octubre de 2026

Colección organizada de ejemplos (textos, imágenes, tablas, audios) que se usa para entrenar, validar y probar modelos de IA.

Explicado fácil

Un conjunto de datos es el material con el que aprende una IA. Si quieres un modelo que reconozca perros, necesitas muchas fotos de perros; si quieres uno que escriba español, necesitas muchísimo texto en español.

Una analogía

Son los libros de texto del estudiante. Si los libros están incompletos, tienen errores o solo muestran un punto de vista, el estudiante aprenderá justo eso.

Un ejemplo

MNIST es un conjunto clásico de 70 000 imágenes de dígitos escritos a mano. Los grandes modelos de lenguaje se entrenan con conjuntos mucho mayores, formados por páginas web, libros, código y otras fuentes de texto.

Cómo funciona (nivel técnico)

Lo habitual es dividir los datos en tres partes: entrenamiento (para ajustar el modelo), validación (para elegir hiperparámetros y detectar sobreajuste) y prueba (para una evaluación final honesta). Antes de usarlos se limpian, se eliminan duplicados, se filtran contenidos y, en el aprendizaje supervisado, se etiquetan. Un problema serio es la contaminación: que ejemplos de la prueba aparezcan en el entrenamiento, lo que infla artificialmente los resultados.

Errores comunes

  • Creer que más cantidad compensa mala calidad.
  • Olvidar que los sesgos de los datos pasan al modelo.
  • Evaluar con los mismos datos con los que se entrenó.