Oossa

llama.cpp 加快 CUDA top‑k 选择

开源库 Llama.cpp 现已在 CUDA top‑k 中采用基数选择算法,在一项大型测试中将运行时间从 5.76 s 降至 0.94 s。

简讯作者: Oossa 发布日期: 1 分钟阅读

llama.cpp 项目于 2026 年 10 月 8 日发布新版本(b11513)。新版本将此前逐行执行的 CUDA top‑k 算法替换为按行网格化的基数选择算法。在 Qwen‑4‑exp 模型处理 34,816 个 token 的测试中,top‑k 调用次数从 1,671,253 次(5,761.8 ms)降至 2,329 次(941.8 ms)。此次更新还新增了根据矩阵形状自动选择最佳 top‑k 算法的功能,并调整了 bitonic 和 radix 路径的阈值。

为什么重要

在 Nvidia GPU 上运行大型语言模型的开发者,可望获得约六倍快的 top‑k 运算,从而加快推理和训练。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。