Oossa

llama.cpp、MoEエキスパート向けGPUキャッシュを追加

オープンソースのllama.cppが、ホストメモリ上に保持するMoE(混合エキスパート)データ用GPUキャッシュに対応した。

短信著者: Oossa公開日: 最終更新: 1 分で読める

ggml-orgチームは2026-10-08、llama.cppのバージョンb11480をリリースした。今回のアップデートでは、ホストメモリ上に配置するMoEエキスパート向けGPUキャッシュを追加し、大規模モデルをGPU上でより高速に実行できるようにした。この変更には「assisted-by Claude」と記されており、新しいllama_moe_cache_ptr APIを使用する。macOS、iOS、一部のUbuntu構成向けのビルド済みバイナリをダウンロードできる。

なぜ重要か

開発者はMoEモデルを一般向けGPUでより効率よく実行できるようになり、AIプロジェクトに必要なハードウェアコストを抑えられる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。