llama.cpp 项目于 2026 年 10 月 8 日发布 b11482 版本。该版本新增 CUDA FWHT 内核,支持宽度超过 512 的数据块,将支持范围扩展至 1,024 至 8,192,适用于 FP32 和 FP16 数据。此次改动复用了现有的 F16 基础设施,并在 A10 GPU 上通过测试。现有的 warp 宽度内核(64 至 512)保持不变。
为什么重要
GPU 用户现在可以借助 llama.cpp 更快地运行宽度更大的矩阵乘法。
2026 年 10 月 8 日发布的版本新增快速傅里叶—哈达玛变换内核,可在 NVIDIA GPU 上处理宽度为 1,024 至 8,192 的数据块。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
llama.cpp 项目于 2026 年 10 月 8 日发布 b11482 版本。该版本新增 CUDA FWHT 内核,支持宽度超过 512 的数据块,将支持范围扩展至 1,024 至 8,192,适用于 FP32 和 FP16 数据。此次改动复用了现有的 F16 基础设施,并在 A10 GPU 上通过测试。现有的 warp 宽度内核(64 至 512)保持不变。
GPU 用户现在可以借助 llama.cpp 更快地运行宽度更大的矩阵乘法。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。