ggml-org 团队于 2026-10-09 发布 llama.cpp b11534 版本。此次更新将状态快照拷贝合并到循环缓存中,并在 K = 1(非推测解码)时移除多余的 CUDA 拷贝。此项改动仅适用于 CUDA 后端,因此 CPU 和 Vulkan 构建版本不受影响。macOS、iOS 和多个 Ubuntu 版本的预编译二进制文件已开放下载。
使用 CUDA 版本的用户,GPU 内存传输量预计会略有减少,从而可能提升受支持硬件上的运行速度。
为什么重要
CUDA 用户可能会获得更快的推理速度,因为该库减少了 GPU 上的数据传输。