Onderzoekers hebben galahad‑kv uitgebracht, een openbare geheugenlaag die de key-value-status van een taalmodel versleuteld opslaat op een lokale NVMe-schijf. Daardoor kan het model een blok van 16.000 tokens opnieuw laden zonder het opnieuw te berekenen. Tests met de modellen Gemma 4 12B en 31B op één NVIDIA H100 lieten zien dat het laden 2,8‑4,3 keer sneller ging en over een stroom van 50 miljoen tokens 8,8‑12,3 keer minder GPU-energie kostte. Het 31B-model beantwoordde feitelijke vragen over eerdere passages in de tekst 98 % van de tijd correct.
Waarom het ertoe doet
Zo kunnen ontwikkelaars toepassingen met een zeer lange context op één GPU draaien, met minder kosten en stroomverbruik.