O NVIDIA Dynamo agora é compatível com um identificador de sessão que permite aos servidores de inferência tratar uma sequência de chamadas a LLMs como um único programa. O ID é lido em cabeçalhos já existentes de agentes de programação populares, como Claude Code, Codex e OpenCode, e pode ser adicionado a estruturas personalizadas com um único cabeçalho X‑Dynamo‑Session‑ID. Com esse identificador, o Dynamo pode encaminhar solicitações, compartilhar o cache KV e pausar sessões nos pontos em que os agentes usam ferramentas, reduzindo a necessidade de pré-carregar novamente contextos extensos.
Por que importa
Desenvolvedores de assistentes de programação com IA podem reduzir a latência porque o sistema reutiliza o contexto em cache, em vez de carregá-lo repetidamente.