OossaL'IA évolue vite. Nous l'expliquons simplement.

llama.cpp optimise la multiplication matricielle des modèles MoE

La version du 30 septembre 2026 ajuste le choix des tuiles Vulkan, réduisant le travail inutile dans les modèles Mixture-of-Experts.

BrèveOossa1 min de lecture

La bibliothèque open source llama.cpp a intégré un correctif Vulkan pour la multiplication matricielle adaptée aux MoE. Cette modification ajuste le choix de la taille des tuiles pour l’opération mat_mul_id, afin de tenir compte du nombre réel de lignes actives pour chaque expert. Lors d’un test sur un modèle de 30 milliards de paramètres, le correctif a réduit le travail inutile du GPU, qui représentait auparavant 55 % du temps d’exécution.

Pourquoi c'est important

Moins de temps GPU perdu signifie une inférence plus rapide pour les grands modèles MoE exécutés sur du matériel compatible avec Vulkan.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

Sources et références

#SourceMédiaDateÀ retenir
1ggml-org/llama.cpp b11265 ↗llama.cpp29 sept. 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 sources

Dernière mise à jour: ·Markdown·llms.txt