De open-sourcelibrary llama.cpp bevat nu een Vulkan-fix voor MoE-bewuste matrixvermenigvuldiging. De wijziging past aan hoe de code de tilegroottes kiest voor de bewerking mat_mul_id, zodat die aansluiten bij het werkelijke aantal actieve rijen per expert. In een test met een model van 30 miljard parameters verminderde de fix de ongebruikte GPU-rekenkracht, die eerder 55% van de looptijd opslokte.
Waarom het ertoe doet
Minder ongebruikte GPU-tijd betekent snellere inferentie voor grote MoE-modellen op Vulkan-compatibele hardware.