Oossa

llama.cpp v0.1.11534 优化 CUDA 数据拷贝

这款开源 LLaMA 推理库减少了多余的 GPU 内存传输,降低特定工作负载的开销。

简讯作者: Oossa 发布日期: 1 分钟阅读

ggml-org 团队于 2026-10-09 发布 llama.cpp b11534 版本。此次更新将状态快照拷贝合并到循环缓存中,并在 K = 1(非推测解码)时移除多余的 CUDA 拷贝。此项改动仅适用于 CUDA 后端,因此 CPU 和 Vulkan 构建版本不受影响。macOS、iOS 和多个 Ubuntu 版本的预编译二进制文件已开放下载。

使用 CUDA 版本的用户,GPU 内存传输量预计会略有减少,从而可能提升受支持硬件上的运行速度。

为什么重要

CUDA 用户可能会获得更快的推理速度,因为该库减少了 GPU 上的数据传输。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。