Métricas de evaluación
Medidas que resumen el rendimiento de un modelo en datos de evaluación y ayudan a comparar resultados según una tarea y un uso concretos.
Explicado fácil
Una métrica es una forma de resumir qué tan bien responde un modelo a ejemplos que no usó para entrenarse. No hay una única medida que describa por completo todos los aciertos, errores y consecuencias.
Una analogía
Para evaluar a un equipo no basta con contar goles: también puede importar cuántos tiros necesitó, contra quién jugó y qué resultado buscaba.
Un ejemplo
En detección de spam, la exactitud mide la proporción total de aciertos; la precisión indica qué proporción de los mensajes marcados como spam sí lo eran; el recall mide cuántos de los correos spam existentes encontró el filtro.
Cómo funciona (nivel técnico)
Para clasificación se utilizan, entre otras, exactitud, precisión, recall y F1; para regresión, error absoluto medio y error cuadrático medio. La matriz de confusión desglosa predicciones por clase. Se calcula la métrica en una partición de evaluación adecuada y se interpreta junto con la distribución de datos, umbrales y costes de falsos positivos y negativos.
Errores comunes
- Escoger una métrica popular sin vincularla a la decisión que tomará el sistema.
- Usar exactitud como única medida con clases muy desequilibradas.
- Presentar una cifra sin intervalo, contexto, conjunto de evaluación o comparación relevante.