Projektet ggml‑org/llama.cpp släppte version b11372 den 3 oktober 2026. Uppdateringen skriver om Qwen4exp-indexeraren så att varje head beräknar sin poäng separat och skriver resultaten direkt på plats. Det halverar minnesbehovet för indexerarens poängbuffertar, som stod för den största minnesanvändningen i grafer med lång kontext. Ändringen påverkar inte beräkningshastigheten och lägger också till stöd för den nya lightning-indexeraren i CUDA-, Metal- och Vulkan-bakändarna.
Varför det spelar roll
Utvecklare som kör stora språkmodeller med lång kontext kan få plats med större prompter på samma hårdvara.