OossaAI 发展迅速。我们用简单的话讲清楚。

llama.cpp 为 Intel Vulkan 构建加入双精度对齐 F32 加载

这项更新通过每次加载两个浮点数,提升 Intel GPU 上的矩阵乘法速度。

简讯Oossa1 分钟阅读

llama.cpp 项目发布了一项补丁,调整了 Vulkan 代码加载 32 位浮点数(F32)的方式。在 Intel GPU 上,一次加载两个浮点数比逐个加载更快,因此新逻辑在 mul_mat_vec 例程中采用了 2 对齐加载。这项改动还补上了此前缺失的对齐检查。B60 测试板上的基准测试显示,在特定矩阵尺寸下,性能最高可达 1.63 TFLOPS,较此前版本有明显提升。

为什么重要

GPU 运算速度更快,意味着在 Intel 硬件上使用 llama.cpp 的用户可以更快地进行大语言模型推理。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1ggml-org/llama.cpp b11266 ↗llama.cpp2026年9月29日<details open> vulkan : Load F32 A matrix 2 at a time when its 2-aligned (#29254) It turns out Intel doesn't particularly like loading F32s
2ggml-org/llama.cpp b11267 ↗llama.cpp2026年9月30日<details open> vulkan: Tune GDN kernel, fix Intel performance (#29476) * vulkan: tune GDN shader * tune for Intel </details> **Website:** -

2 个来源

最后更新: ·Markdown·llms.txt