llama.cpp 项目于 2026‑10‑11 发布 b11554 版本。此次更新新增了 Vulkan 专项修复:在矩阵乘法中检测重复的行 ID,并通过预处理统一处理,而不再逐个循环。此外,“hoist row ids”优化也得到改进,现在始终会运行,并可生成多个紧凑的图块。这些改动能减少 GPU 启动的工作组数量,并在可能时提前退出。
为什么重要
llama.cpp 的 GPU 用户有望获得更快的推理速度,因为该库现在可以避免重复执行相同的计算。
这款开源 LLaMA 推理库现在会跳过 GPU 上重复行的冗余计算,提升 Vulkan 设备上的运行速度。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
llama.cpp 项目于 2026‑10‑11 发布 b11554 版本。此次更新新增了 Vulkan 专项修复:在矩阵乘法中检测重复的行 ID,并通过预处理统一处理,而不再逐个循环。此外,“hoist row ids”优化也得到改进,现在始终会运行,并可生成多个紧凑的图块。这些改动能减少 GPU 启动的工作组数量,并在可能时提前退出。
llama.cpp 的 GPU 用户有望获得更快的推理速度,因为该库现在可以避免重复执行相同的计算。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。