Mezcla de expertos
Arquitectura en la que un modelo se compone de muchos bloques especializados y, para cada token, solo se activan unos pocos, de modo que es grande pero barato de ejecutar.
Explicado fácil
En lugar de un único cerebro que lo hace todo, imagina un hospital con muchos especialistas y un recepcionista que decide a quién pasar cada caso. No hace falta que trabajen todos para cada paciente: basta con los más adecuados.
Una analogía
Es una gran consultoría: tiene cientos de profesionales, pero para cada proyecto solo se asigna a dos o tres expertos. La empresa es enorme y, sin embargo, cada proyecto cuesta lo que cuesta un equipo pequeño.
Un ejemplo
Un modelo puede tener 400 000 millones de parámetros en total y, aun así, usar solo 40 000 millones por cada palabra que genera, de modo que responde con la velocidad de un modelo mucho menor.
Cómo funciona (nivel técnico)
En un transformer con MoE, las capas densas de alimentación se sustituyen por un conjunto de N subredes llamadas expertos. Una pequeña red llamada enrutador (router) decide, para cada token, a qué k expertos enviarlo (a menudo k = 1 o 2) y combina sus salidas ponderadas. Esto separa los parámetros totales (capacidad de almacenar conocimiento) de los parámetros activos (coste de cómputo por token). Los retos son equilibrar la carga entre expertos y la memoria necesaria, porque todos los expertos deben estar cargados aunque se usen pocos.
Errores comunes
- Pensar que cada experto se especializa en un tema humano (“matemáticas”, “francés”). Las especializaciones aprendidas suelen ser más sutiles, como patrones sintácticos.
- Comparar modelos solo por el número total de parámetros, sin mirar los activos.