ggml-org-teamet släppte llama.cpp version b11534 den 2026-10-09. Uppdateringen integrerar kopior av tillståndsögonblicksbilder i den rekurrenta cachen och tar bort extra CUDA-kopior när K = 1, ett fall med avkodning utan spekulativ avkodning. Ändringen gäller endast CUDA-backendmiljön, så versioner för CPU och Vulkan påverkas inte. Förkompilerade binärfiler för macOS, iOS och flera varianter av Ubuntu finns att ladda ner.
Användare av CUDA-versionen bör märka av något mindre minnestrafik på GPU:n, vilket kan ge högre hastighet på maskinvara som stöds.
Varför det spelar roll
CUDA-användare kan få snabbare inferens eftersom biblioteket nu flyttar mindre data på GPU:n.