Det öppna biblioteket llama.cpp har fått en Vulkan-fix för matrismultiplikation som tar hänsyn till MoE. Ändringen justerar hur koden väljer plattstorlekar för operationen mat_mul_id, så att de motsvarar det faktiska antalet aktiva rader per expert. I ett test med en modell på 30 miljarder parametrar minskade fixen mängden outnyttjat GPU-arbete, som tidigare stod för 55 procent av körtiden.
Varför det spelar roll
Mindre outnyttjad GPU-tid innebär snabbare inferens för stora MoE-modeller på Vulkan-kompatibel hårdvara.