Saltar al contenido

División de datos

Nivel básico Revisado el 6 de octubre de 2026

Separación de un conjunto de datos en partes para entrenar un modelo, tomar decisiones durante su desarrollo y evaluar su rendimiento final.

Explicado fácil

Para saber si un modelo aprenderá algo útil y no solo memorizará sus ejemplos, se reservan datos para distintas etapas. El modelo se ajusta con una parte y se evalúa con otras que no debe usar para aprender.

Una analogía

Es como estudiar con ejercicios de práctica, usar un simulacro para decidir qué repasar y reservar un examen final cuyas respuestas no se han visto antes.

Un ejemplo

En una tarea de clasificación, el conjunto de entrenamiento enseña al modelo; el de validación ayuda a comparar configuraciones; y el de prueba se consulta al final para estimar el rendimiento en datos no vistos.

Cómo funciona (nivel técnico)

Una división habitual reserva entrenamiento, validación y prueba. Las proporciones dependen del tamaño y del problema. En datos temporales se debe respetar el orden cronológico; en datos agrupados, evitar que registros de una misma persona aparezcan en varias particiones. Las transformaciones aprendidas de los datos, como escalar características, se ajustan solo con entrenamiento para evitar filtraciones.

Errores comunes

  • Usar el conjunto de prueba repetidamente para elegir el modelo: deja de ser una evaluación independiente.
  • Dividir al azar datos correlacionados y permitir que casi duplicados queden a ambos lados.
  • Olvidar que el método de división debe reflejar cómo llegarán los datos reales.