OossaAI utvecklas fort. Vi förklarar det enkelt.

llama.cpp effektiviserar matrismultiplikation för MoE

Versionen från 30 september 2026 finjusterar valet av Vulkan-plattor och minskar onödigt arbete i Mixture-of-Experts-modeller.

NotisOossa1 min läsning

Det öppna biblioteket llama.cpp har fått en Vulkan-fix för matrismultiplikation som tar hänsyn till MoE. Ändringen justerar hur koden väljer plattstorlekar för operationen mat_mul_id, så att de motsvarar det faktiska antalet aktiva rader per expert. I ett test med en modell på 30 miljarder parametrar minskade fixen mängden outnyttjat GPU-arbete, som tidigare stod för 55 procent av körtiden.

Varför det spelar roll

Mindre outnyttjad GPU-tid innebär snabbare inferens för stora MoE-modeller på Vulkan-kompatibel hårdvara.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

Källor och referenser

#KällaUtgivareDatumKärnpunkt
1ggml-org/llama.cpp b11265 ↗llama.cpp29 sep. 2026<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 källor

Senast uppdaterad: ·Markdown·llms.txt