A equipe ggml-org lançou a versão b11534 do llama.cpp em 2026-10-09. A atualização incorpora as cópias de snapshots de estado ao cache recorrente e elimina cópias CUDA extras quando K = 1, um caso de decodificação sem especulação. A mudança se limita ao backend CUDA; as versões para CPU e Vulkan não foram alteradas. Há binários pré-compilados para macOS, iOS e várias versões do Ubuntu disponíveis para download.
Quem usa a versão CUDA deve notar uma pequena redução no tráfego de memória da GPU, o que pode melhorar a velocidade em hardware compatível.
Por que importa
A inferência pode ficar mais rápida para usuários de CUDA, porque a biblioteca agora transfere menos dados na GPU.