Het project ggml-org/llama.cpp bracht op 3 oktober 2026 versie b11372 uit. De update herschrijft de Qwen4exp-indexer, zodat elke head afzonderlijk zijn score berekent en de resultaten direct wegschrijft. Daardoor is voor de scorebuffers van de indexer nog maar de helft van het geheugen nodig. Die buffers waren bij lange contexten de grootste geheugengebruikers. De wijziging heeft geen invloed op de rekensnelheid en voegt ook ondersteuning toe voor de nieuwe lightning-indexer op de CUDA-, Metal- en Vulkan-backends.
Waarom het ertoe doet
Ontwikkelaars die grote taalmodellen met lange contexten gebruiken, kunnen op dezelfde hardware grotere prompts verwerken.