Oossa

llama.cppの更新でインデクサーのメモリ使用量が半減

b11372ではQwen4expのインデクサーを改良。長いコンテキストでの実行時に、速度を落とさずRAM使用量を大幅に削減します。

短信OossaOossa公開日: 1 分で読める

ggml-org/llama.cppプロジェクトは2026年10月3日、バージョンb11372を公開しました。この更新ではQwen4expのインデクサーを書き換え、各ヘッドが個別にスコアを計算し、結果をその場で書き込むようにしました。これにより、長いコンテキストの計算グラフで最大のメモリ使用要因だったインデクサーのスコアバッファに必要なメモリが半減します。計算速度への影響はなく、CUDA、Metal、Vulkanの各バックエンドで新しいlightningインデクサーもサポートします。

なぜ重要か

長いコンテキストで大規模言語モデルを実行する開発者は、同じハードウェアでより大きなプロンプトを扱えるようになります。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。