NVIDIA Dynamo prend désormais en charge un identifiant de session qui permet aux serveurs d’inférence de traiter une série d’appels à un LLM comme un seul programme. Cet identifiant est lu dans les en-têtes existants d’agents de programmation populaires comme Claude Code, Codex et OpenCode. Il peut aussi être ajouté aux environnements personnalisés à l’aide d’un seul en-tête X‑Dynamo‑Session‑ID. Grâce à cet identifiant, Dynamo peut acheminer les requêtes, partager le cache KV et mettre les sessions en pause aux étapes où des outils sont utilisés, ce qui réduit la nécessité de préremplir à nouveau de grands contextes.
Pourquoi c'est important
Les développeurs d’assistants de programmation IA peuvent réduire la latence, car le système réutilise le contexte en cache au lieu de le charger à répétition.