ggml-org/llama.cppプロジェクトは2026年10月3日、バージョンb11372を公開しました。この更新ではQwen4expのインデクサーを書き換え、各ヘッドが個別にスコアを計算し、結果をその場で書き込むようにしました。これにより、長いコンテキストの計算グラフで最大のメモリ使用要因だったインデクサーのスコアバッファに必要なメモリが半減します。計算速度への影響はなく、CUDA、Metal、Vulkanの各バックエンドで新しいlightningインデクサーもサポートします。
なぜ重要か
長いコンテキストで大規模言語モデルを実行する開発者は、同じハードウェアでより大きなプロンプトを扱えるようになります。