Saltar al contenido

Métricas de evaluación

Nivel intermedio Revisado el 6 de octubre de 2026

Medidas que resumen el rendimiento de un modelo en datos de evaluación y ayudan a comparar resultados según una tarea y un uso concretos.

Explicado fácil

Una métrica es una forma de resumir qué tan bien responde un modelo a ejemplos que no usó para entrenarse. No hay una única medida que describa por completo todos los aciertos, errores y consecuencias.

Una analogía

Para evaluar a un equipo no basta con contar goles: también puede importar cuántos tiros necesitó, contra quién jugó y qué resultado buscaba.

Un ejemplo

En detección de spam, la exactitud mide la proporción total de aciertos; la precisión indica qué proporción de los mensajes marcados como spam sí lo eran; el recall mide cuántos de los correos spam existentes encontró el filtro.

Cómo funciona (nivel técnico)

Para clasificación se utilizan, entre otras, exactitud, precisión, recall y F1; para regresión, error absoluto medio y error cuadrático medio. La matriz de confusión desglosa predicciones por clase. Se calcula la métrica en una partición de evaluación adecuada y se interpreta junto con la distribución de datos, umbrales y costes de falsos positivos y negativos.

Errores comunes

  • Escoger una métrica popular sin vincularla a la decisión que tomará el sistema.
  • Usar exactitud como única medida con clases muy desequilibradas.
  • Presentar una cifra sin intervalo, contexto, conjunto de evaluación o comparación relevante.