Forskare har släppt ett offentligt minneslager med namnet galahad‑kv, som sparar en språkmodells key-value-tillstånd på en krypterad lokal NVMe-disk. Det gör att modellen kan läsa in ett block på 16,000 tokens utan att behöva beräkna det på nytt. Tester med en enda NVIDIA H100 och modellerna Gemma 4 12B och 31B visade att inläsningen gick 2.8‑4.3 gånger snabbare och förbrukade 8.8‑12.3 gånger mindre GPU-energi under en ström på 50 million tokens. Modellen 31B besvarade faktabaserade frågor om tidigare delar av texten korrekt i 98 % av fallen.
Varför det spelar roll
Det gör det möjligt för utvecklare att köra program med mycket lång kontext på en enda GPU och därmed minska kostnader och strömförbrukning.