ggml-orgチームは2026-10-08、llama.cppのバージョンb11480をリリースした。今回のアップデートでは、ホストメモリ上に配置するMoEエキスパート向けGPUキャッシュを追加し、大規模モデルをGPU上でより高速に実行できるようにした。この変更には「assisted-by Claude」と記されており、新しいllama_moe_cache_ptr APIを使用する。macOS、iOS、一部のUbuntu構成向けのビルド済みバイナリをダウンロードできる。
なぜ重要か
開発者はMoEモデルを一般向けGPUでより効率よく実行できるようになり、AIプロジェクトに必要なハードウェアコストを抑えられる。