# llama.cpp optimise la multiplication matricielle des modèles MoE

> La version du 30 septembre 2026 ajuste le choix des tuiles Vulkan, réduisant le travail inutile dans les modèles Mixture-of-Experts.

Oossa · 2026-09-29 · https://oossa.com/fr/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

La bibliothèque open source llama.cpp a intégré un correctif Vulkan pour la multiplication matricielle adaptée aux MoE. Cette modification ajuste le choix de la taille des tuiles pour l’opération mat_mul_id, afin de tenir compte du nombre réel de lignes actives pour chaque expert. Lors d’un test sur un modèle de 30 milliards de paramètres, le correctif a réduit le travail inutile du GPU, qui représentait auparavant 55 % du temps d’exécution.

## Les faits

- La version b11265 est sortie le 30 septembre 2026
- Lors du test Sarvam 30B, la part de travail inutile est passée de 55 % à près de zéro

## Pourquoi c'est important

Moins de temps GPU perdu signifie une inférence plus rapide pour les grands modèles MoE exécutés sur du matériel compatible avec Vulkan.

## Sources et références

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Dernière mise à jour: 2026-09-29
