# llama.cpp v0.1.11534 优化 CUDA 数据拷贝

> 这款开源 LLaMA 推理库减少了多余的 GPU 内存传输，降低特定工作负载的开销。

Oossa · 2026-10-09 · https://oossa.com/zh/llama-cpp-v0-1-11534-adds-cuda-copy-optimizations

ggml-org 团队于 2026-10-09 发布 llama.cpp b11534 版本。此次更新将状态快照拷贝合并到循环缓存中，并在 K = 1（非推测解码）时移除多余的 CUDA 拷贝。此项改动仅适用于 CUDA 后端，因此 CPU 和 Vulkan 构建版本不受影响。macOS、iOS 和多个 Ubuntu 版本的预编译二进制文件已开放下载。

使用 CUDA 版本的用户，GPU 内存传输量预计会略有减少，从而可能提升受支持硬件上的运行速度。

## 事实

- b11534 版本于 2026-10-09 发布
- CUDA 拷贝移除适用于 K = 1（非推测解码）场景

## 为什么重要

CUDA 用户可能会获得更快的推理速度，因为该库减少了 GPU 上的数据传输。

## 来源与参考

1. [ggml-org/llama.cpp b11534](https://github.com/ggml-org/llama.cpp/releases/tag/b11534) – llama.cpp, 2026-10-09

最后更新: 2026-10-09
