# llama.cpp 修复 CPU 对 BF16 矩阵输入的处理

> b11292 版本新增对深度卷积所用 BF16 矩阵输入的 CPU 支持，并收紧 Vulkan 的支持条件。

Oossa · 2026-09-30 · https://oossa.com/zh/llama-cpp-fixes-cpu-handling-for-bf16-matrix-inputs

借助 AI 编写和翻译。请核对下方原始来源。

llama.cpp b11292 版本修复了 CPU 后端的一项限制：当深度 1D 卷积的卷积核使用 BF16（一种 16 位数值格式）时，CPU 后端此前无法处理。现在，CPU 后端会先将该输入扩展为 32 位浮点数再进行计算，与 Metal 矩阵-向量内核采用的运算方式一致。

此版本还调整了 Vulkan 的检查条件：只有当第一个矩阵输入也是 BF16 时，才会接受作为第二个矩阵输入的 BF16。其他组合会被标记为不受支持，以便调度器将其分配给 CPU。更新说明提到新增了测试，但未说明这些改动何时会进入打包应用，也未说明哪些用户会获得这些改动。

## 事实

- llama.cpp b11292 版本于 2026 年 9 月 30 日发布。
- 更新说明涵盖一项针对 F32、F16 和 BF16 卷积核的深度卷积测试，以及三种将 BF16 作为第二个输入的矩阵乘法情形。

## 为什么重要

对于运行 BF16 深度卷积的开发者，CPU 后端现在可以处理此前不支持的一种组合；更新说明未提及下游应用何时会包含此修复。

## 来源与参考

1. [ggml-org/llama.cpp b11292](https://github.com/ggml-org/llama.cpp/releases/tag/b11292) – llama.cpp, 2026-09-30

最后更新: 2026-09-30
