# llama.cpp 更新：支持 OpenVINO 2026.4.1 并修复 MoE 问题

> 2026 年 10 月 3 日发布的更新升级了 OpenVINO 后端、提升了性能，并修正 llama.cpp 对 MoE 模型的处理。

Oossa · 2026-10-03 · https://oossa.com/zh/llama-cpp-release-adds-openvino-2026-4-1-support-and-moe-fixes

llama.cpp 库于 2026 年 10 月 3 日发布新版本（b11374）。该版本将 OpenVINO 后端升级至 2026.4.1，新增卷积融合，修复 GPU 缓冲区错误，并纠正混合专家（MoE）模型的轴处理方式。这些改动提升了融合 MoE 模型的 token 生成速度，也避免了部分 Intel GPU 上的崩溃问题。

## 事实

- 发布日期：2026 年 10 月 3 日（“Sat Oct 03 2026 13:51:21 GMT+0200”）
- OpenVINO 升级至 2026.4.1；gemma-4-26B 的 token 生成速度在融合后从 66 t/s 提升至 1 609 t/s

## 为什么重要

在 Intel GPU 上运行 llama.cpp 的开发者现在可以使用 OpenVINO，获得更快的速度并减少崩溃。

## 来源与参考

1. [ggml-org/llama.cpp b11374](https://github.com/ggml-org/llama.cpp/releases/tag/b11374) – llama.cpp, 2026-10-03
2. [ggml-org/llama.cpp b11377](https://github.com/ggml-org/llama.cpp/releases/tag/b11377) – llama.cpp, 2026-10-03

最后更新: 2026-10-03
