GPU
Chip diseñado para hacer muchísimos cálculos sencillos a la vez, ideal para entrenar y ejecutar modelos de IA.
Explicado fácil
GPU significa “unidad de procesamiento gráfico”. Nació para dibujar videojuegos, que exigen calcular millones de píxeles simultáneamente. Resulta que entrenar una red neuronal necesita también millones de operaciones parecidas a la vez, así que las GPU se convirtieron en el motor de la IA moderna.
Una analogía
Un procesador normal (CPU) es un chef experto que prepara platos complejos de uno en uno. Una GPU es una cocina con miles de ayudantes que, cada uno, solo sabe pelar patatas, pero lo hacen todos a la vez. Para pelar un millón de patatas, gana la cocina grande.
Un ejemplo
Entrenar un modelo de lenguaje grande requiere miles de GPU funcionando en paralelo durante semanas. Los servicios de IA en la nube mantienen enormes centros de datos llenos de ellas.
Cómo funciona (nivel técnico)
El núcleo de una red neuronal son multiplicaciones de matrices, una operación muy paralelizable. Las GPU modernas incluyen unidades especializadas (como los tensor cores) y memoria de gran ancho de banda. Existen también chips específicos como las TPU de Google. El cuello de botella suele ser la memoria: los pesos y los estados intermedios deben caber en ella, de ahí que técnicas como la cuantización sean tan valiosas. Para modelos muy grandes se reparte el trabajo entre muchas GPU conectadas por redes de alta velocidad.
Errores comunes
- Pensar que cualquier gráfica de videojuegos sirve para entrenar modelos grandes. Sirve para modelos pequeños o medianos, pero la memoria es el límite.
- Olvidar que la IA tiene un coste energético y de hardware considerable.