NVIDIA Dynamo har nu stöd för en sessionsidentifierare som gör att inferensservrar kan behandla en kedja av LLM-anrop som ett enda program. ID:t hämtas från befintliga headers hos populära kodningsagenter som Claude Code, Codex och OpenCode. Det kan också läggas till i egna ramverk med en enda header: X‑Dynamo‑Session‑ID. Med identifieraren kan Dynamo dirigera förfrågningar, dela KV-cache och pausa sessioner vid verktygsgränser, vilket minskar behovet av att förbehandla stora kontexter på nytt.
Varför det spelar roll
Utvecklare av AI-kodningsassistenter kan få lägre svarstid eftersom systemet återanvänder cachad kontext i stället för att läsa in den på nytt varje gång.