NVIDIA Dynamo现已支持会话级标识符,让推理服务器能够将一连串LLM调用视为同一个程序。该标识符可从Claude Code、Codex和OpenCode等热门编程智能体的现有请求头中读取;自定义执行框架则只需添加一个X‑Dynamo‑Session‑ID请求头即可使用。借助这一标识符,Dynamo可以路由请求、共享KV缓存,并在调用工具时暂停会话,从而减少重新预填充大量上下文的需要。
为什么重要
AI编程助手的开发者可以降低延迟,因为系统会复用缓存的上下文,而不是反复加载。
这项新功能通过稳定的会话ID,在多轮交互中保留缓存上下文,提升编程助手和工具调用型智能体的速度。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
NVIDIA Dynamo现已支持会话级标识符,让推理服务器能够将一连串LLM调用视为同一个程序。该标识符可从Claude Code、Codex和OpenCode等热门编程智能体的现有请求头中读取;自定义执行框架则只需添加一个X‑Dynamo‑Session‑ID请求头即可使用。借助这一标识符,Dynamo可以路由请求、共享KV缓存,并在调用工具时暂停会话,从而减少重新预填充大量上下文的需要。
AI编程助手的开发者可以降低延迟,因为系统会复用缓存的上下文,而不是反复加载。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。