# llama.cpp、MoEエキスパート向けGPUキャッシュを追加

> オープンソースのllama.cppが、ホストメモリ上に保持するMoE（混合エキスパート）データ用GPUキャッシュに対応した。

Oossa · 2026-10-08 · https://oossa.com/ja/llama-cpp-adds-gpu-cache-for-moe-experts

ggml-orgチームは2026-10-08、llama.cppのバージョンb11480をリリースした。今回のアップデートでは、ホストメモリ上に配置するMoEエキスパート向けGPUキャッシュを追加し、大規模モデルをGPU上でより高速に実行できるようにした。この変更には「assisted-by Claude」と記されており、新しいllama_moe_cache_ptr APIを使用する。macOS、iOS、一部のUbuntu構成向けのビルド済みバイナリをダウンロードできる。

## 事実

- リリースバージョン：b11480
- リリース日：2026-10-08

## なぜ重要か

開発者はMoEモデルを一般向けGPUでより効率よく実行できるようになり、AIプロジェクトに必要なハードウェアコストを抑えられる。

## 出典と参考資料

1. [ggml-org/llama.cpp b11480](https://github.com/ggml-org/llama.cpp/releases/tag/b11480) – llama.cpp, 2026-10-08
2. [Cascadia: Resident 975B MoE Inference on Eleven AI PCs](https://arxiv.org/abs/2610.07219) – arXiv, 2026-10-07

最終更新: 2026-10-08
