Saltar al contenido

GPU

Nivel básico Revisado el 6 de octubre de 2026

Chip diseñado para hacer muchísimos cálculos sencillos a la vez, ideal para entrenar y ejecutar modelos de IA.

Explicado fácil

GPU significa “unidad de procesamiento gráfico”. Nació para dibujar videojuegos, que exigen calcular millones de píxeles simultáneamente. Resulta que entrenar una red neuronal necesita también millones de operaciones parecidas a la vez, así que las GPU se convirtieron en el motor de la IA moderna.

Una analogía

Un procesador normal (CPU) es un chef experto que prepara platos complejos de uno en uno. Una GPU es una cocina con miles de ayudantes que, cada uno, solo sabe pelar patatas, pero lo hacen todos a la vez. Para pelar un millón de patatas, gana la cocina grande.

Un ejemplo

Entrenar un modelo de lenguaje grande requiere miles de GPU funcionando en paralelo durante semanas. Los servicios de IA en la nube mantienen enormes centros de datos llenos de ellas.

Cómo funciona (nivel técnico)

El núcleo de una red neuronal son multiplicaciones de matrices, una operación muy paralelizable. Las GPU modernas incluyen unidades especializadas (como los tensor cores) y memoria de gran ancho de banda. Existen también chips específicos como las TPU de Google. El cuello de botella suele ser la memoria: los pesos y los estados intermedios deben caber en ella, de ahí que técnicas como la cuantización sean tan valiosas. Para modelos muy grandes se reparte el trabajo entre muchas GPU conectadas por redes de alta velocidad.

Errores comunes

  • Pensar que cualquier gráfica de videojuegos sirve para entrenar modelos grandes. Sirve para modelos pequeños o medianos, pero la memoria es el límite.
  • Olvidar que la IA tiene un coste energético y de hardware considerable.