Oossa

llama.cpp halverar indexerarens minnesanvändning

Version b11372 gör att Qwen4exp-indexeraren använder betydligt mindre RAM utan att tappa hastighet vid körningar med lång kontext.

NotisOossaPublicerad av Oossa: 1 min läsning

Projektet ggml‑org/llama.cpp släppte version b11372 den 3 oktober 2026. Uppdateringen skriver om Qwen4exp-indexeraren så att varje head beräknar sin poäng separat och skriver resultaten direkt på plats. Det halverar minnesbehovet för indexerarens poängbuffertar, som stod för den största minnesanvändningen i grafer med lång kontext. Ändringen påverkar inte beräkningshastigheten och lägger också till stöd för den nya lightning-indexeraren i CUDA-, Metal- och Vulkan-bakändarna.

Varför det spelar roll

Utvecklare som kör stora språkmodeller med lång kontext kan få plats med större prompter på samma hårdvara.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.