# 记忆层让 AI 更快、更省地复用 5000 万 token 上下文

> galahad‑kv 软件包将 KV 状态存储在加密 NVMe 硬盘上，使长文本处理的计算时间缩短 2.8–4.3 倍，能耗降低 8.8–12.3 倍。

Oossa · 2026-10-09 · https://oossa.com/zh/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

研究人员发布了一款名为 galahad‑kv 的公开记忆层，可将语言模型的键值（KV）状态保存到本地加密 NVMe 硬盘。这样，模型重新载入一个 16,000 token 的文本块时，无需重新计算。研究人员在单块 NVIDIA H100 上使用 Gemma 4 12B 和 31B 模型进行测试；在处理 5000 万 token 的文本流时，载入速度提升了 2.8–4.3 倍，GPU 能耗降低了 8.8–12.3 倍。31B 模型对文本前文中的事实问题，答对率达到 98%。

## 事实

- 记忆层将 16,000 token 文本块的 KV 状态存储在加密 NVMe 硬盘上。
- 载入文本块的速度提升了 2.8–4.3 倍，GPU 能耗降低了 8.8–12.3 倍。

## 为什么重要

开发者可以在单块 GPU 上运行超长上下文应用，同时降低成本和耗电量。

## 来源与参考

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

最后更新: 2026-10-09
