# llama.cpp halveert geheugengebruik van indexer

> In release b11372 gebruikt de Qwen4exp-indexer veel minder RAM, zonder snelheidsverlies, bij lange contexten.

Oossa · 2026-10-03 · https://oossa.com/nl/llama-cpp-update-cuts-indexer-memory-use-in-half

Het project ggml-org/llama.cpp bracht op 3 oktober 2026 versie b11372 uit. De update herschrijft de Qwen4exp-indexer, zodat elke head afzonderlijk zijn score berekent en de resultaten direct wegschrijft. Daardoor is voor de scorebuffers van de indexer nog maar de helft van het geheugen nodig. Die buffers waren bij lange contexten de grootste geheugengebruikers. De wijziging heeft geen invloed op de rekensnelheid en voegt ook ondersteuning toe voor de nieuwe lightning-indexer op de CUDA-, Metal- en Vulkan-backends.

## De feiten

- Releaselabel b11372 gepubliceerd op zaterdag 3 oktober 2026
- Het geheugengebruik voor indexerscores is met ongeveer 50% verlaagd

## Waarom het ertoe doet

Ontwikkelaars die grote taalmodellen met lange contexten gebruiken, kunnen op dezelfde hardware grotere prompts verwerken.

## Bronnen en referenties

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

Laatst bijgewerkt: 2026-10-03
