Saltar al contenido

YOLO

Nivel intermedio Revisado el 6 de octubre de 2026

Familia de detectores de objetos que predicen clases y ubicaciones de objetos en una imagen mediante una red neuronal de una sola etapa.

Explicado fácil

YOLO localiza varios objetos dentro de una imagen y propone qué es cada uno, junto con un recuadro que marca dónde aparece. Su diseño busca hacer la detección en una sola pasada de la red.

Una analogía

Es como mirar una fotografía completa y señalar de una vez todos los objetos importantes, en lugar de recortar cientos de zonas y examinarlas por separado.

Un ejemplo

En un vídeo de una calle, un detector de la familia YOLO puede marcar vehículos y peatones en cada fotograma, asignándoles una clase y una puntuación de confianza.

Cómo funciona (nivel técnico)

El YOLO original formuló la detección como una predicción directa desde los píxeles a cajas delimitadoras y probabilidades de clase, usando una red convolucional. Las versiones posteriores han cambiado arquitectura, cabezales y estrategias de entrenamiento; por eso «YOLO» designa una familia de modelos, no una única implementación inmutable.

Errores comunes

  • Suponer que todas las versiones tienen idéntica arquitectura o rendimiento: la familia ha evolucionado.
  • Confundir detección con clasificación: la detección también estima ubicación y puede localizar varios objetos.
  • Interpretar la puntuación del modelo como certeza garantizada; es una estimación que requiere evaluación y umbrales adecuados.