llama.cpp 库于 2026 年 10 月 3 日发布新版本(b11374)。该版本将 OpenVINO 后端升级至 2026.4.1,新增卷积融合,修复 GPU 缓冲区错误,并纠正混合专家(MoE)模型的轴处理方式。这些改动提升了融合 MoE 模型的 token 生成速度,也避免了部分 Intel GPU 上的崩溃问题。
为什么重要
在 Intel GPU 上运行 llama.cpp 的开发者现在可以使用 OpenVINO,获得更快的速度并减少崩溃。
2026 年 10 月 3 日发布的更新升级了 OpenVINO 后端、提升了性能,并修正 llama.cpp 对 MoE 模型的处理。
简讯OossaOossa 发布日期: 1 分钟阅读
llama.cpp 库于 2026 年 10 月 3 日发布新版本(b11374)。该版本将 OpenVINO 后端升级至 2026.4.1,新增卷积融合,修复 GPU 缓冲区错误,并纠正混合专家(MoE)模型的轴处理方式。这些改动提升了融合 MoE 模型的 token 生成速度,也避免了部分 Intel GPU 上的崩溃问题。
在 Intel GPU 上运行 llama.cpp 的开发者现在可以使用 OpenVINO,获得更快的速度并减少崩溃。
最后更新: ·Markdown
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。