# llama.cpp 为 Intel Vulkan 构建加入双精度对齐 F32 加载

> 这项更新通过每次加载两个浮点数，提升 Intel GPU 上的矩阵乘法速度。

Oossa · 2026-09-30 · https://oossa.com/zh/llama-cpp-adds-2-aligned-f32-loads-for-intel-vulkan-builds

llama.cpp 项目发布了一项补丁，调整了 Vulkan 代码加载 32 位浮点数（F32）的方式。在 Intel GPU 上，一次加载两个浮点数比逐个加载更快，因此新逻辑在 mul_mat_vec 例程中采用了 2 对齐加载。这项改动还补上了此前缺失的对齐检查。B60 测试板上的基准测试显示，在特定矩阵尺寸下，性能最高可达 1.63 TFLOPS，较此前版本有明显提升。

## 事实

- 补丁于 2026 年 9 月 30 日发布（b11266）
- 在 4096×8×14336 矩阵上，速度最高可达 1.63 TFLOPS

## 为什么重要

GPU 运算速度更快，意味着在 Intel 硬件上使用 llama.cpp 的用户可以更快地进行大语言模型推理。

## 来源与参考

1. [ggml-org/llama.cpp b11266](https://github.com/ggml-org/llama.cpp/releases/tag/b11266) – llama.cpp, 2026-09-29
2. [ggml-org/llama.cpp b11267](https://github.com/ggml-org/llama.cpp/releases/tag/b11267) – llama.cpp, 2026-09-30

最后更新: 2026-09-30
