# llama.cpp更新、MoEの行列乗算を効率化

> 2026年9月30日のリリースでVulkanのタイル選択を調整し、Mixture-of-Expertsモデルの無駄な処理を削減。

Oossa · 2026-09-29 · https://oossa.com/ja/llama-cpp-update-improves-moe-matrix-multiplication-efficiency

オープンソースのllama.cppライブラリに、MoEを考慮した行列乗算のVulkan向け修正が加わった。mat_mul_id処理でタイルサイズを選ぶ方法を調整し、各エキスパートで実際に有効な行数に合わせる。300億パラメーターのモデルを使ったテストでは、実行時間の55%を占めていたGPUのアイドル処理が、この修正によって削減された。

## 事実

- バージョンb11265を2026年9月30日に公開
- Sarvam 30Bのテストでは、性能上の無駄が55%からほぼゼロに低下

## なぜ重要か

GPUのアイドル時間が減れば、Vulkan対応ハードウェアで動かす大規模MoEモデルの推論が速くなる。

## 出典と参考資料

1. [ggml-org/llama.cpp b11265](https://github.com/ggml-org/llama.cpp/releases/tag/b11265) – llama.cpp, 2026-09-29

最終更新: 2026-09-29
