llama.cpp 项目于 2026 年 10 月 8 日发布新版本(b11513)。新版本将此前逐行执行的 CUDA top‑k 算法替换为按行网格化的基数选择算法。在 Qwen‑4‑exp 模型处理 34,816 个 token 的测试中,top‑k 调用次数从 1,671,253 次(5,761.8 ms)降至 2,329 次(941.8 ms)。此次更新还新增了根据矩阵形状自动选择最佳 top‑k 算法的功能,并调整了 bitonic 和 radix 路径的阈值。
为什么重要
在 Nvidia GPU 上运行大型语言模型的开发者,可望获得约六倍快的 top‑k 运算,从而加快推理和训练。