Oossa

llama.cpp 新增支持宽度超过 512 的 CUDA 内核

2026 年 10 月 8 日发布的版本新增快速傅里叶—哈达玛变换内核,可在 NVIDIA GPU 上处理宽度为 1,024 至 8,192 的数据块。

简讯作者: Oossa 发布日期: 1 分钟阅读

llama.cpp 项目于 2026 年 10 月 8 日发布 b11482 版本。该版本新增 CUDA FWHT 内核,支持宽度超过 512 的数据块,将支持范围扩展至 1,024 至 8,192,适用于 FP32 和 FP16 数据。此次改动复用了现有的 F16 基础设施,并在 A10 GPU 上通过测试。现有的 warp 宽度内核(64 至 512)保持不变。

为什么重要

GPU 用户现在可以借助 llama.cpp 更快地运行宽度更大的矩阵乘法。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。