# llama.cpp 新增 Vulkan 重复行优化

> 这款开源 LLaMA 推理库现在会跳过 GPU 上重复行的冗余计算，提升 Vulkan 设备上的运行速度。

Oossa · 2026-10-11 · https://oossa.com/zh/llama-cpp-adds-vulkan-duplicate-row-optimizations

llama.cpp 项目于 2026‑10‑11 发布 b11554 版本。此次更新新增了 Vulkan 专项修复：在矩阵乘法中检测重复的行 ID，并通过预处理统一处理，而不再逐个循环。此外，“hoist row ids”优化也得到改进，现在始终会运行，并可生成多个紧凑的图块。这些改动能减少 GPU 启动的工作组数量，并在可能时提前退出。

## 事实

- b11554 版本于 2026 年 10 月 11 日（周日）发布
- llama.cpp 新增了 Vulkan 重复行处理功能

## 为什么重要

llama.cpp 的 GPU 用户有望获得更快的推理速度，因为该库现在可以避免重复执行相同的计算。

## 来源与参考

1. [ggml-org/llama.cpp b11554](https://github.com/ggml-org/llama.cpp/releases/tag/b11554) – llama.cpp, 2026-10-11

最后更新: 2026-10-11
