Oossa

llama.cpp、MoEキャッシュの複数GPU対応を追加

オープンソースライブラリのllama.cppで、複数のGPUにまたがってMixture of Expertsモデルを実行できるようになりました。

短信著者: Oossa公開日: 1 分で読める

ggml-orgチームは2026年10月8日、llama.cppのバージョンb11507を公開しました。このアップデートでは、複数のGPUに分散できるMixture of Experts(MoE)キャッシュに対応しました。これにより、開発者はすべてを1枚のGPUに収めなくても、より大規模なMoEモデルを実行できます。また、macOS、iOS、およびCUDA 12.8対応を含む複数のLinux環境向けに、新しいバイナリパッケージも提供されます。

なぜ重要か

複数GPUを搭載した環境で、より大規模で高性能なAIモデルを実行できるようになり、個人向けハードウェアで可能なことが広がります。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。