Oossa

Geheugenlaag verwerkt context van 50 miljoen tokens sneller en goedkoper

Het pakket galahad‑kv slaat KV-status versleuteld op NVMe op. Bij lange teksten is de rekentijd 2,8‑4,3× korter en het energieverbruik 8,8‑12,3× lager.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Onderzoekers hebben galahad‑kv uitgebracht, een openbare geheugenlaag die de key-value-status van een taalmodel versleuteld opslaat op een lokale NVMe-schijf. Daardoor kan het model een blok van 16.000 tokens opnieuw laden zonder het opnieuw te berekenen. Tests met de modellen Gemma 4 12B en 31B op één NVIDIA H100 lieten zien dat het laden 2,8‑4,3 keer sneller ging en over een stroom van 50 miljoen tokens 8,8‑12,3 keer minder GPU-energie kostte. Het 31B-model beantwoordde feitelijke vragen over eerdere passages in de tekst 98 % van de tijd correct.

Waarom het ertoe doet

Zo kunnen ontwikkelaars toepassingen met een zeer lange context op één GPU draaien, met minder kosten en stroomverbruik.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.