Saltar al contenido

Visión por computador

Nivel básico Revisado el 6 de octubre de 2026

Rama de la IA que permite a las máquinas interpretar imágenes y vídeos: reconocer objetos, personas, texto o escenas.

Explicado fácil

Para un ordenador, una foto es una enorme tabla de números (la intensidad de color de cada píxel). La visión por computador es el conjunto de técnicas que convierte esos números en comprensión: “aquí hay un coche, allí un peatón”.

Una analogía

Es darle ojos a un ordenador y, sobre todo, enseñarle a interpretar lo que ve. Como los ojos humanos captan luz pero es el cerebro quien reconoce un rostro, la parte difícil es el reconocimiento.

Un ejemplo

El desbloqueo facial del móvil, la lectura automática de matrículas, los coches que detectan señales y peatones, o las herramientas que ayudan a los radiólogos a localizar posibles lesiones en radiografías.

Cómo funciona (nivel técnico)

Las tareas clásicas son la clasificación (¿qué hay en la imagen?), la detección (¿dónde está cada objeto?), la segmentación (¿qué píxeles pertenecen a cada objeto?) y el seguimiento en vídeo. El gran salto vino en 2012 con las redes convolucionales, que aplican filtros que detectan bordes, texturas y formas jerárquicamente; arquitecturas como ResNet permitieron redes muy profundas. Más recientemente, los Vision Transformers tratan una imagen como una secuencia de parches, igual que un modelo de lenguaje trata las palabras.

Errores comunes

  • Creer que funciona igual de bien con cualquier persona o condición: se han documentado diferencias de precisión según tono de piel, género o iluminación.
  • Fiarse de un modelo fuera de su contexto de entrenamiento. Uno entrenado con imágenes de día puede fallar de noche.