La bibliothèque open source llama.cpp a intégré un correctif Vulkan pour la multiplication matricielle adaptée aux MoE. Cette modification ajuste le choix de la taille des tuiles pour l’opération mat_mul_id, afin de tenir compte du nombre réel de lignes actives pour chaque expert. Lors d’un test sur un modèle de 30 milliards de paramètres, le correctif a réduit le travail inutile du GPU, qui représentait auparavant 55 % du temps d’exécution.
Pourquoi c'est important
Moins de temps GPU perdu signifie une inférence plus rapide pour les grands modèles MoE exécutés sur du matériel compatible avec Vulkan.