OossaAI ontwikkelt zich snel. Wij leggen het eenvoudig uit.

llama.cpp-update maakt MoE-matrixvermenigvuldiging efficiënter

De release van 30 september 2026 past de selectie van Vulkan-tiles aan en voorkomt verspilde rekenkracht bij Mixture-of-Experts-modellen.

Kort berichtOossa1 min lezen

De open-sourcelibrary llama.cpp bevat nu een Vulkan-fix voor MoE-bewuste matrixvermenigvuldiging. De wijziging past aan hoe de code de tilegroottes kiest voor de bewerking mat_mul_id, zodat die aansluiten bij het werkelijke aantal actieve rijen per expert. In een test met een model van 30 miljard parameters verminderde de fix de ongebruikte GPU-rekenkracht, die eerder 55% van de looptijd opslokte.

Waarom het ertoe doet

Minder ongebruikte GPU-tijd betekent snellere inferentie voor grote MoE-modellen op Vulkan-compatibele hardware.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.

Bronnen en referenties

#BronMediumDatumKernpunt
1ggml-org/llama.cpp b11265 ↗llama.cpp29 sep 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 bronnen

Laatst bijgewerkt: ·Markdown·llms.txt