研究者らは、言語モデルのキー・バリュー(KV)状態を暗号化したローカルNVMeディスクに保存する、公開メモリ層「galahad‑kv」を公開した。これにより、モデルは16,000トークンのブロックを再計算せずに読み込める。Gemma 4の12Bモデルと31Bモデルを使い、NVIDIA H100 1基で行ったテストでは、5,000万トークンのストリーム処理において、読み込み速度は2.8〜4.3倍になり、GPUの消費エネルギーは8.8〜12.3分の1に減った。31Bモデルは、テキストの前半に書かれた内容についての事実確認の質問に、98%の確率で正しく回答した。
なぜ重要か
開発者は、コストと消費電力を抑えながら、GPU 1基で非常に長いコンテキストを扱うアプリケーションを実行できる。