# AIの長文処理を高速・低コストにするメモリ層

> galahad‑kvはKV状態を暗号化したNVMeに保存。長文処理で計算時間を2.8〜4.3倍短縮し、消費エネルギーを8.8〜12.3分の1に抑える。

Oossa · 2026-10-09 · https://oossa.com/ja/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

研究者らは、言語モデルのキー・バリュー（KV）状態を暗号化したローカルNVMeディスクに保存する、公開メモリ層「galahad‑kv」を公開した。これにより、モデルは16,000トークンのブロックを再計算せずに読み込める。Gemma 4の12Bモデルと31Bモデルを使い、NVIDIA H100 1基で行ったテストでは、5,000万トークンのストリーム処理において、読み込み速度は2.8〜4.3倍になり、GPUの消費エネルギーは8.8〜12.3分の1に減った。31Bモデルは、テキストの前半に書かれた内容についての事実確認の質問に、98％の確率で正しく回答した。

## 事実

- メモリ層は、16,000トークンのブロックのKV状態を暗号化したNVMeに保存する。
- ブロックの読み込み速度は2.8〜4.3倍になり、GPUの消費エネルギーは8.8〜12.3分の1になった。

## なぜ重要か

開発者は、コストと消費電力を抑えながら、GPU 1基で非常に長いコンテキストを扱うアプリケーションを実行できる。

## 出典と参考資料

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

最終更新: 2026-10-09
