Oossa

llama.cpp halveert geheugengebruik van indexer

In release b11372 gebruikt de Qwen4exp-indexer veel minder RAM, zonder snelheidsverlies, bij lange contexten.

Kort berichtOossaGepubliceerd door Oossa: 1 min lezen

Het project ggml-org/llama.cpp bracht op 3 oktober 2026 versie b11372 uit. De update herschrijft de Qwen4exp-indexer, zodat elke head afzonderlijk zijn score berekent en de resultaten direct wegschrijft. Daardoor is voor de scorebuffers van de indexer nog maar de helft van het geheugen nodig. Die buffers waren bij lange contexten de grootste geheugengebruikers. De wijziging heeft geen invloed op de rekensnelheid en voegt ook ondersteuning toe voor de nieuwe lightning-indexer op de CUDA-, Metal- en Vulkan-backends.

Waarom het ertoe doet

Ontwikkelaars die grote taalmodellen met lange contexten gebruiken, kunnen op dezelfde hardware grotere prompts verwerken.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.