NVIDIA Dynamo unterstützt jetzt eine sitzungsbezogene Kennung, mit der Inferenzserver eine Folge von LLM-Aufrufen als ein einziges Programm behandeln können. Die ID wird aus vorhandenen Headern gängiger Coding-Agenten wie Claude Code, Codex und OpenCode ausgelesen. Eigene Harnesses können sie über den einzelnen Header X‑Dynamo‑Session‑ID hinzufügen. Anhand dieser Kennung kann Dynamo Anfragen weiterleiten, den KV-Cache gemeinsam nutzen und Sitzungen an den Übergängen zu Tools pausieren. So müssen umfangreiche Kontexte seltener erneut vorab verarbeitet werden.
Warum es wichtig ist
Entwickler von KI-Coding-Assistenten profitieren von geringeren Latenzen, weil das System Kontext aus dem Cache wiederverwendet, statt ihn wiederholt neu zu laden.