Oossa

NVIDIA Dynamo routeert AI-workloads nu per sessie

De nieuwe functie gebruikt een vaste sessie-ID om context tussen meerdere beurten in de cache te houden. Dat versnelt codeerassistenten en agents die tools gebruiken.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

NVIDIA Dynamo ondersteunt nu een identificatiecode op sessieniveau, waarmee inferentieservers een reeks LLM-aanroepen als één programma kunnen behandelen. De ID wordt uit bestaande headers van populaire codeeragents zoals Claude Code, Codex en OpenCode gelezen. In aangepaste frameworks kan de ID worden toegevoegd met één X‑Dynamo‑Session‑ID-header. Met deze identificatiecode kan Dynamo aanvragen routeren, de KV-cache delen en sessies pauzeren op momenten dat tools worden aangeroepen. Daardoor hoeft een grote context minder vaak opnieuw te worden ingeladen.

Waarom het ertoe doet

Ontwikkelaars van AI-codeerassistenten kunnen profiteren van een lagere latentie, omdat het systeem context uit de cache hergebruikt in plaats van die telkens opnieuw te laden.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.