NVIDIA Dynamo ora supporta un identificativo a livello di sessione, che permette ai server di inferenza di trattare una sequenza di chiamate a un LLM come un unico programma. L’ID viene letto dagli header già usati da agenti di programmazione diffusi come Claude Code, Codex e OpenCode; può inoltre essere aggiunto agli harness personalizzati tramite un singolo header X‑Dynamo‑Session‑ID. Grazie a questo identificativo, Dynamo può instradare le richieste, condividere la cache KV e sospendere le sessioni quando si passa agli strumenti, riducendo la necessità di ricalcolare il prefill di contesti estesi.
Perché conta
Gli sviluppatori di assistenti di programmazione basati sull’AI possono ridurre la latenza perché il sistema riutilizza il contesto memorizzato nella cache invece di caricarlo ripetutamente.