研究人员发布了一款名为 galahad‑kv 的公开记忆层,可将语言模型的键值(KV)状态保存到本地加密 NVMe 硬盘。这样,模型重新载入一个 16,000 token 的文本块时,无需重新计算。研究人员在单块 NVIDIA H100 上使用 Gemma 4 12B 和 31B 模型进行测试;在处理 5000 万 token 的文本流时,载入速度提升了 2.8–4.3 倍,GPU 能耗降低了 8.8–12.3 倍。31B 模型对文本前文中的事实问题,答对率达到 98%。
为什么重要
开发者可以在单块 GPU 上运行超长上下文应用,同时降低成本和耗电量。