# llama.cpp、MoEキャッシュの複数GPU対応を追加

> オープンソースライブラリのllama.cppで、複数のGPUにまたがってMixture of Expertsモデルを実行できるようになりました。

Oossa · 2026-10-08 · https://oossa.com/ja/llama-cpp-adds-multi-gpu-moe-cache-support

ggml-orgチームは2026年10月8日、llama.cppのバージョンb11507を公開しました。このアップデートでは、複数のGPUに分散できるMixture of Experts（MoE）キャッシュに対応しました。これにより、開発者はすべてを1枚のGPUに収めなくても、より大規模なMoEモデルを実行できます。また、macOS、iOS、およびCUDA 12.8対応を含む複数のLinux環境向けに、新しいバイナリパッケージも提供されます。

## 事実

- バージョンb11507を2026-10-08に公開
- 複数GPUにまたがるMoEキャッシュに対応

## なぜ重要か

複数GPUを搭載した環境で、より大規模で高性能なAIモデルを実行できるようになり、個人向けハードウェアで可能なことが広がります。

## 出典と参考資料

1. [ggml-org/llama.cpp b11507](https://github.com/ggml-org/llama.cpp/releases/tag/b11507) – llama.cpp, 2026-10-08

最終更新: 2026-10-08
