OossaAIは急速に進化しています。私たちがわかりやすく解説します。

llama.cpp更新、MoEの行列乗算を効率化

2026年9月30日のリリースでVulkanのタイル選択を調整し、Mixture-of-Expertsモデルの無駄な処理を削減。

短信Oossa1 分で読める

オープンソースのllama.cppライブラリに、MoEを考慮した行列乗算のVulkan向け修正が加わった。mat_mul_id処理でタイルサイズを選ぶ方法を調整し、各エキスパートで実際に有効な行数に合わせる。300億パラメーターのモデルを使ったテストでは、実行時間の55%を占めていたGPUのアイドル処理が、この修正によって削減された。

なぜ重要か

GPUのアイドル時間が減れば、Vulkan対応ハードウェアで動かす大規模MoEモデルの推論が速くなる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。

出典と参考資料

#出典媒体日付要点
1ggml-org/llama.cpp b11265 ↗llama.cpp2026/09/29<details open> vulkan: MOE aware mat_mul_id tile selection (#29182) mut_mul_id selected its matmul tile with total token count.

1 件の出典

最終更新: ·Markdown·llms.txt