# llama.cpp halverar indexerarens minnesanvändning

> Version b11372 gör att Qwen4exp-indexeraren använder betydligt mindre RAM utan att tappa hastighet vid körningar med lång kontext.

Oossa · 2026-10-03 · https://oossa.com/sv/llama-cpp-update-cuts-indexer-memory-use-in-half

Projektet ggml‑org/llama.cpp släppte version b11372 den 3 oktober 2026. Uppdateringen skriver om Qwen4exp-indexeraren så att varje head beräknar sin poäng separat och skriver resultaten direkt på plats. Det halverar minnesbehovet för indexerarens poängbuffertar, som stod för den största minnesanvändningen i grafer med lång kontext. Ändringen påverkar inte beräkningshastigheten och lägger också till stöd för den nya lightning-indexeraren i CUDA-, Metal- och Vulkan-bakändarna.

## Fakta

- Versionsetiketten b11372 publicerades lördag 3 oktober 2026
- Minnesanvändningen för indexerarens poäng minskade med cirka 50 %

## Varför det spelar roll

Utvecklare som kör stora språkmodeller med lång kontext kan få plats med större prompter på samma hårdvara.

## Källor och referenser

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Senast uppdaterad: 2026-10-03
