# llama.cpp 新增支持宽度超过 512 的 CUDA 内核

> 2026 年 10 月 8 日发布的版本新增快速傅里叶—哈达玛变换内核，可在 NVIDIA GPU 上处理宽度为 1,024 至 8,192 的数据块。

Oossa · 2026-10-08 · https://oossa.com/zh/llama-cpp-adds-cuda-kernels-for-block-widths-over-512

llama.cpp 项目于 2026 年 10 月 8 日发布 b11482 版本。该版本新增 CUDA FWHT 内核，支持宽度超过 512 的数据块，将支持范围扩展至 1,024 至 8,192，适用于 FP32 和 FP16 数据。此次改动复用了现有的 F16 基础设施，并在 A10 GPU 上通过测试。现有的 warp 宽度内核（64 至 512）保持不变。

## 事实

- 版本标签为 b11482，发布于 2026 年 10 月 8 日
- 新增内核支持 FP32 和 FP16，宽度范围为 1,024 至 8,192

## 为什么重要

GPU 用户现在可以借助 llama.cpp 更快地运行宽度更大的矩阵乘法。

## 来源与参考

1. [ggml-org/llama.cpp b11482](https://github.com/ggml-org/llama.cpp/releases/tag/b11482) – llama.cpp, 2026-10-08

最后更新: 2026-10-08
