# llama.cpp 更新提升 MoE 矩阵乘法效率

> 2026 年 9 月 30 日发布的更新调整了 Vulkan 分块选择，减少混合专家模型中的无效计算。

Oossa · 2026-09-29 · https://oossa.com/zh/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

开源库 llama.cpp 为支持 MoE 的矩阵乘法加入了一项 Vulkan 修复。此次改动调整了代码为 mat_mul_id 操作选择分块大小的方式，使其与每位专家实际激活的行数相匹配。在一项针对 300 亿参数模型的测试中，这项修复减少了 GPU 空转；此前空转占运行时间的 55%。

## 事实

- 版本 b11265 于 2026 年 9 月 30 日发布
- 在 Sarvam 30B 测试中，性能损耗从 55% 降至接近于零

## 为什么重要

减少 GPU 空转时间，意味着在兼容 Vulkan 的硬件上运行大型 MoE 模型时，推理速度更快。

## 来源与参考

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

最后更新: 2026-09-29
