Het ggml‑org-team heeft op 2026-10-09 versie b11534 van llama.cpp uitgebracht. De update voegt kopieën van statusmomentopnamen samen met de recurrent cache en schrapt extra CUDA-kopieën wanneer K = 1, een geval zonder speculatieve decoding. De wijziging geldt alleen voor de CUDA-backend; CPU- en Vulkan-builds blijven ongewijzigd. Vooraf gebouwde binaries voor macOS, iOS en verschillende Ubuntu-varianten zijn te downloaden.
Gebruikers van de CUDA-versie zouden iets minder GPU-geheugenverkeer moeten zien, wat de snelheid op ondersteunde hardware kan verbeteren.
Waarom het ertoe doet
CUDA-gebruikers kunnen profiteren van snellere inferentie doordat de bibliotheek minder data op de GPU verplaatst.