# llama.cpp-update maakt MoE-matrixvermenigvuldiging efficiënter

> De release van 30 september 2026 past de selectie van Vulkan-tiles aan en voorkomt verspilde rekenkracht bij Mixture-of-Experts-modellen.

Oossa · 2026-09-29 · https://oossa.com/nl/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

De open-sourcelibrary llama.cpp bevat nu een Vulkan-fix voor MoE-bewuste matrixvermenigvuldiging. De wijziging past aan hoe de code de tilegroottes kiest voor de bewerking mat_mul_id, zodat die aansluiten bij het werkelijke aantal actieve rijen per expert. In een test met een model van 30 miljard parameters verminderde de fix de ongebruikte GPU-rekenkracht, die eerder 55% van de looptijd opslokte.

## De feiten

- Releaseversie b11265 verscheen op 30 september 2026
- In de test met Sarvam 30B daalde het aandeel verspilde rekenkracht van 55% tot bijna nul

## Waarom het ertoe doet

Minder ongebruikte GPU-tijd betekent snellere inferentie voor grote MoE-modellen op Vulkan-compatibele hardware.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Laatst bijgewerkt: 2026-09-29
