# llama.cppの更新でインデクサーのメモリ使用量が半減

> b11372ではQwen4expのインデクサーを改良。長いコンテキストでの実行時に、速度を落とさずRAM使用量を大幅に削減します。

Oossa · 2026-10-03 · https://oossa.com/ja/llama-cpp-update-cuts-indexer-memory-use-in-half

ggml-org/llama.cppプロジェクトは2026年10月3日、バージョンb11372を公開しました。この更新ではQwen4expのインデクサーを書き換え、各ヘッドが個別にスコアを計算し、結果をその場で書き込むようにしました。これにより、長いコンテキストの計算グラフで最大のメモリ使用要因だったインデクサーのスコアバッファに必要なメモリが半減します。計算速度への影響はなく、CUDA、Metal、Vulkanの各バックエンドで新しいlightningインデクサーもサポートします。

## 事実

- リリースタグb11372は2026年10月3日（土）に公開
- インデクサーのスコア用メモリを約50％削減

## なぜ重要か

長いコンテキストで大規模言語モデルを実行する開発者は、同じハードウェアでより大きなプロンプトを扱えるようになります。

## 出典と参考資料

1. [ggml-org/llama.cpp b11372](https://github.com/ggml-org/llama.cpp/releases/tag/b11372) – llama.cpp, 2026-10-03

最終更新: 2026-10-03
