Oossa

AIの長文処理を高速・低コストにするメモリ層

galahad‑kvはKV状態を暗号化したNVMeに保存。長文処理で計算時間を2.8〜4.3倍短縮し、消費エネルギーを8.8〜12.3分の1に抑える。

短信著者: Oossa公開日: 1 分で読める

研究者らは、言語モデルのキー・バリュー(KV)状態を暗号化したローカルNVMeディスクに保存する、公開メモリ層「galahad‑kv」を公開した。これにより、モデルは16,000トークンのブロックを再計算せずに読み込める。Gemma 4の12Bモデルと31Bモデルを使い、NVIDIA H100 1基で行ったテストでは、5,000万トークンのストリーム処理において、読み込み速度は2.8〜4.3倍になり、GPUの消費エネルギーは8.8〜12.3分の1に減った。31Bモデルは、テキストの前半に書かれた内容についての事実確認の質問に、98%の確率で正しく回答した。

なぜ重要か

開発者は、コストと消費電力を抑えながら、GPU 1基で非常に長いコンテキストを扱うアプリケーションを実行できる。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。