Oossa

Minneslager återanvänder 50 miljoner tokens snabbare och billigare

Paketet galahad‑kv lagrar KV-tillstånd på krypterad NVMe, vilket minskar beräkningstiden 2.8‑4.3× och energiförbrukningen 8.8‑12.3× för långa texter.

NotisAv Publicerad av Oossa: 1 min läsning

Forskare har släppt ett offentligt minneslager med namnet galahad‑kv, som sparar en språkmodells key-value-tillstånd på en krypterad lokal NVMe-disk. Det gör att modellen kan läsa in ett block på 16,000 tokens utan att behöva beräkna det på nytt. Tester med en enda NVIDIA H100 och modellerna Gemma 4 12B och 31B visade att inläsningen gick 2.8‑4.3 gånger snabbare och förbrukade 8.8‑12.3 gånger mindre GPU-energi under en ström på 50 million tokens. Modellen 31B besvarade faktabaserade frågor om tidigare delar av texten korrekt i 98 % av fallen.

Varför det spelar roll

Det gör det möjligt för utvecklare att köra program med mycket lång kontext på en enda GPU och därmed minska kostnader och strömförbrukning.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.