Oossa

llama.cpp 新增 Vulkan 重复行优化

这款开源 LLaMA 推理库现在会跳过 GPU 上重复行的冗余计算,提升 Vulkan 设备上的运行速度。

简讯作者: Oossa 发布日期: 1 分钟阅读

llama.cpp 项目于 2026‑10‑11 发布 b11554 版本。此次更新新增了 Vulkan 专项修复:在矩阵乘法中检测重复的行 ID,并通过预处理统一处理,而不再逐个循环。此外,“hoist row ids”优化也得到改进,现在始终会运行,并可生成多个紧凑的图块。这些改动能减少 GPU 启动的工作组数量,并在可能时提前退出。

为什么重要

llama.cpp 的 GPU 用户有望获得更快的推理速度,因为该库现在可以避免重复执行相同的计算。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。