# llama.cpp effektiviserar matrismultiplikation för MoE

> Versionen från 30 september 2026 finjusterar valet av Vulkan-plattor och minskar onödigt arbete i Mixture-of-Experts-modeller.

Oossa · 2026-09-29 · https://oossa.com/sv/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

Det öppna biblioteket llama.cpp har fått en Vulkan-fix för matrismultiplikation som tar hänsyn till MoE. Ändringen justerar hur koden väljer plattstorlekar för operationen mat_mul_id, så att de motsvarar det faktiska antalet aktiva rader per expert. I ett test med en modell på 30 miljarder parametrar minskade fixen mängden outnyttjat GPU-arbete, som tidigare stod för 55 procent av körtiden.

## Fakta

- Version b11265 släpptes den 30 september 2026
- Det onödiga prestandaarbetet sjönk från 55 procent till nära noll i testet med Sarvam 30B

## Varför det spelar roll

Mindre outnyttjad GPU-tid innebär snabbare inferens för stora MoE-modeller på Vulkan-kompatibel hårdvara.

## Källor och referenser

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

Senast uppdaterad: 2026-09-29
