La biblioteca de código abierto llama.cpp incorporó una corrección de Vulkan para la multiplicación de matrices adaptada a MoE. El cambio modifica la forma en que el código selecciona el tamaño de los bloques para la operación mat_mul_id, de modo que coincida con la cantidad real de filas activas por experto. En una prueba con un modelo de 30.000 millones de parámetros, la corrección redujo el trabajo inactivo de la GPU, que había representado el 55 % del tiempo de ejecución.
Por qué importa
Menos tiempo de inactividad de la GPU se traduce en inferencias más rápidas para modelos MoE grandes en hardware compatible con Vulkan.