# Geheugenlaag verwerkt context van 50 miljoen tokens sneller en goedkoper

> Het pakket galahad‑kv slaat KV-status versleuteld op NVMe op. Bij lange teksten is de rekentijd 2,8‑4,3× korter en het energieverbruik 8,8‑12,3× lager.

Oossa · 2026-10-09 · https://oossa.com/nl/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Onderzoekers hebben galahad‑kv uitgebracht, een openbare geheugenlaag die de key-value-status van een taalmodel versleuteld opslaat op een lokale NVMe-schijf. Daardoor kan het model een blok van 16.000 tokens opnieuw laden zonder het opnieuw te berekenen. Tests met de modellen Gemma 4 12B en 31B op één NVIDIA H100 lieten zien dat het laden 2,8‑4,3 keer sneller ging en over een stroom van 50 miljoen tokens 8,8‑12,3 keer minder GPU-energie kostte. Het 31B-model beantwoordde feitelijke vragen over eerdere passages in de tekst 98 % van de tijd correct.

## De feiten

- De geheugenlaag slaat de KV-status van blokken van 16.000 tokens versleuteld op NVMe op.
- Een blok laden ging 2,8×‑4,3× sneller en kostte 8,8×‑12,3× minder GPU-energie.

## Waarom het ertoe doet

Zo kunnen ontwikkelaars toepassingen met een zeer lange context op één GPU draaien, met minder kosten en stroomverbruik.

## Bronnen en referenties

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Laatst bijgewerkt: 2026-10-09
