NVIDIA Dynamo가 추론 서버에서 LLM 호출을 연속된 하나의 프로그램으로 처리하도록 세션 단위 식별자를 지원한다. 이 ID는 Claude Code, Codex, OpenCode 같은 인기 코딩 에이전트가 사용하는 기존 헤더에서 읽어오며, 맞춤형 하네스에는 X‑Dynamo‑Session‑ID 헤더 하나를 추가해 사용할 수 있다. Dynamo는 이 식별자를 바탕으로 요청을 라우팅하고 KV 캐시를 공유하며 도구 사용 단계에서 세션을 일시 중지할 수 있어, 대규모 컨텍스트를 다시 프리필해야 하는 경우를 줄인다.
왜 중요한가
AI 코딩 어시스턴트 개발자는 시스템이 컨텍스트를 반복해서 불러오는 대신 캐시를 재사용해 지연 시간이 줄어드는 효과를 기대할 수 있다.