# NVIDIA Dynamo leitet KI-Agenten sitzungsbasiert weiter

> Die neue Funktion nutzt eine stabile Sitzungs-ID, damit der Kontext über mehrere Gesprächsrunden hinweg im Cache bleibt. Das beschleunigt Coding-Assistenten und Agenten, die Tools verwenden.

Oossa · 2026-10-08 · https://oossa.com/de/nvidia-dynamo-adds-session-aware-routing-for-agentic-ai-workloads

NVIDIA Dynamo unterstützt jetzt eine sitzungsbezogene Kennung, mit der Inferenzserver eine Folge von LLM-Aufrufen als ein einziges Programm behandeln können. Die ID wird aus vorhandenen Headern gängiger Coding-Agenten wie Claude Code, Codex und OpenCode ausgelesen. Eigene Harnesses können sie über den einzelnen Header X‑Dynamo‑Session‑ID hinzufügen. Anhand dieser Kennung kann Dynamo Anfragen weiterleiten, den KV-Cache gemeinsam nutzen und Sitzungen an den Übergängen zu Tools pausieren. So müssen umfangreiche Kontexte seltener erneut vorab verarbeitet werden.

## Die Fakten

- Zu den unterstützten Agenten gehören Claude Code, Codex und OpenCode.
- Eigene Harnesses verwenden den Header X‑Dynamo‑Session‑ID.

## Warum es wichtig ist

Entwickler von KI-Coding-Assistenten profitieren von geringeren Latenzen, weil das System Kontext aus dem Cache wiederverwendet, statt ihn wiederholt neu zu laden.

## Quellen und Referenzen

1. [Session-Aware Agentic Inference with NVIDIA Dynamo](https://pytorch.org/blog/session-aware-agentic-inference-with-nvidia-dynamo/) – PyTorch

Zuletzt aktualisiert: 2026-10-08
