# Minneslager återanvänder 50 miljoner tokens snabbare och billigare

> Paketet galahad‑kv lagrar KV-tillstånd på krypterad NVMe, vilket minskar beräkningstiden 2.8‑4.3× och energiförbrukningen 8.8‑12.3× för långa texter.

Oossa · 2026-10-09 · https://oossa.com/sv/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Forskare har släppt ett offentligt minneslager med namnet galahad‑kv, som sparar en språkmodells key-value-tillstånd på en krypterad lokal NVMe-disk. Det gör att modellen kan läsa in ett block på 16,000 tokens utan att behöva beräkna det på nytt. Tester med en enda NVIDIA H100 och modellerna Gemma 4 12B och 31B visade att inläsningen gick 2.8‑4.3 gånger snabbare och förbrukade 8.8‑12.3 gånger mindre GPU-energi under en ström på 50 million tokens. Modellen 31B besvarade faktabaserade frågor om tidigare delar av texten korrekt i 98 % av fallen.

## Fakta

- Minneslagret sparar KV-tillstånd för block på 16,000 tokens på krypterad NVMe.
- Inläsningen av ett block gick 2.8×‑4.3× snabbare och förbrukade 8.8×‑12.3× mindre GPU-energi.

## Varför det spelar roll

Det gör det möjligt för utvecklare att köra program med mycket lång kontext på en enda GPU och därmed minska kostnader och strömförbrukning.

## Källor och referenser

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Senast uppdaterad: 2026-10-09
