ggml-orgチームは2026年10月8日、llama.cppのバージョンb11507を公開しました。このアップデートでは、複数のGPUに分散できるMixture of Experts(MoE)キャッシュに対応しました。これにより、開発者はすべてを1枚のGPUに収めなくても、より大規模なMoEモデルを実行できます。また、macOS、iOS、およびCUDA 12.8対応を含む複数のLinux環境向けに、新しいバイナリパッケージも提供されます。
なぜ重要か
複数GPUを搭載した環境で、より大規模で高性能なAIモデルを実行できるようになり、個人向けハードウェアで可能なことが広がります。