# Speicherschicht macht 50 Millionen Token schneller und günstiger nutzbar

> Das Paket galahad‑kv speichert den KV-Zustand verschlüsselt auf einer NVMe-SSD. Bei langen Texten sinkt die Rechenzeit um das 2,8- bis 4,3-Fache und der Energieverbrauch um das 8,8- bis 12,3-Fache.

Oossa · 2026-10-09 · https://oossa.com/de/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

Forschende haben eine öffentlich verfügbare Speicherschicht namens galahad‑kv vorgestellt. Sie speichert den Key-Value-Zustand eines Sprachmodells auf einer verschlüsselten lokalen NVMe-SSD. So kann das Modell einen Block mit 16.000 Token laden, ohne ihn erneut berechnen zu müssen. Tests mit den Modellen Gemma 4 12B und 31B auf einer einzelnen NVIDIA H100 zeigten, dass das Laden bei einem Datenstrom mit 50 Millionen Token 2,8- bis 4,3-mal schneller war und 8,8- bis 12,3-mal weniger GPU-Energie verbrauchte. Das 31B-Modell beantwortete Faktenfragen zu früheren Textpassagen in 98 % der Fälle richtig.

## Die Fakten

- Die Speicherschicht legt den KV-Zustand für Blöcke mit 16.000 Token verschlüsselt auf einer NVMe-SSD ab.
- Das Laden eines Blocks war 2,8- bis 4,3-mal schneller und verbrauchte 8,8- bis 12,3-mal weniger GPU-Energie.

## Warum es wichtig ist

Entwickler können damit Anwendungen mit sehr langem Kontext auf einer einzelnen GPU ausführen und Kosten sowie Stromverbrauch senken.

## Quellen und Referenzen

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
