Oossa

记忆层让 AI 更快、更省地复用 5000 万 token 上下文

galahad‑kv 软件包将 KV 状态存储在加密 NVMe 硬盘上,使长文本处理的计算时间缩短 2.8–4.3 倍,能耗降低 8.8–12.3 倍。

简讯作者: Oossa 发布日期: 1 分钟阅读

研究人员发布了一款名为 galahad‑kv 的公开记忆层,可将语言模型的键值(KV)状态保存到本地加密 NVMe 硬盘。这样,模型重新载入一个 16,000 token 的文本块时,无需重新计算。研究人员在单块 NVIDIA H100 上使用 Gemma 4 12B 和 31B 模型进行测试;在处理 5000 万 token 的文本流时,载入速度提升了 2.8–4.3 倍,GPU 能耗降低了 8.8–12.3 倍。31B 模型对文本前文中的事实问题,答对率达到 98%。

为什么重要

开发者可以在单块 GPU 上运行超长上下文应用,同时降低成本和耗电量。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。