Das Team von ggml-org hat am 2026-10-09 llama.cpp Version b11534 veröffentlicht. Das Update integriert Kopien von Zustands-Snapshots in den rekurrenten Cache und vermeidet zusätzliche CUDA-Kopien, wenn K = 1 gilt – also bei einem Decoding ohne spekulative Verfahren. Die Änderung betrifft nur das CUDA-Backend; CPU- und Vulkan-Builds bleiben unverändert. Vorgefertigte Binärdateien für macOS, iOS und mehrere Ubuntu-Varianten stehen zum Download bereit.
Wer die CUDA-Version nutzt, dürfte etwas weniger GPU-Speicherverkehr feststellen. Auf unterstützter Hardware kann das die Geschwindigkeit verbessern.
Warum es wichtig ist
CUDA-Nutzer können von einer schnelleren Inferenz profitieren, weil die Bibliothek nun weniger Daten auf der GPU verschiebt.