Il team ggml-org ha rilasciato llama.cpp versione b11534 il 2026-10-09. L’aggiornamento integra le copie degli snapshot dello stato nella cache ricorrente ed elimina copie CUDA aggiuntive quando K = 1, cioè nei casi di decodifica non speculativa. La modifica riguarda solo il backend CUDA: le versioni per CPU e Vulkan restano invariate. Sono disponibili per il download binari precompilati per macOS, iOS e diverse versioni di Ubuntu.
Chi usa la versione CUDA dovrebbe notare un lieve calo del traffico di memoria GPU, che può migliorare la velocità sui dispositivi supportati.
Perché conta
Gli utenti CUDA potrebbero ottenere inferenze più rapide perché la libreria trasferisce meno dati sulla GPU.