# llama.cpp 加快 CUDA top‑k 选择

> 开源库 Llama.cpp 现已在 CUDA top‑k 中采用基数选择算法，在一项大型测试中将运行时间从 5.76 s 降至 0.94 s。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-adds-faster-cuda-top-k-selection

llama.cpp 项目于 2026 年 10 月 8 日发布新版本（b11513）。新版本将此前逐行执行的 CUDA top‑k 算法替换为按行网格化的基数选择算法。在 Qwen‑4‑exp 模型处理 34,816 个 token 的测试中，top‑k 调用次数从 1,671,253 次（5,761.8 ms）降至 2,329 次（941.8 ms）。此次更新还新增了根据矩阵形状自动选择最佳 top‑k 算法的功能，并调整了 bitonic 和 radix 路径的阈值。

## 事实

- 发布日期：2026 年 10 月 8 日——“PUBLISHED: Thu Oct 08 2026”
- Qwen‑4‑exp 上的运行时间从 5,761.8 ms 降至 941.8 ms

## 为什么重要

在 Nvidia GPU 上运行大型语言模型的开发者，可望获得约六倍快的 top‑k 运算，从而加快推理和训练。

## 来源与参考

1. [ggml-org/llama.cpp b11513](https://github.com/ggml-org/llama.cpp/releases/tag/b11513) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
