llama.cpp 项目发布了一项补丁,调整了 Vulkan 代码加载 32 位浮点数(F32)的方式。在 Intel GPU 上,一次加载两个浮点数比逐个加载更快,因此新逻辑在 mul_mat_vec 例程中采用了 2 对齐加载。这项改动还补上了此前缺失的对齐检查。B60 测试板上的基准测试显示,在特定矩阵尺寸下,性能最高可达 1.63 TFLOPS,较此前版本有明显提升。
为什么重要
GPU 运算速度更快,意味着在 Intel 硬件上使用 llama.cpp 的用户可以更快地进行大语言模型推理。