Forschende haben eine öffentlich verfügbare Speicherschicht namens galahad‑kv vorgestellt. Sie speichert den Key-Value-Zustand eines Sprachmodells auf einer verschlüsselten lokalen NVMe-SSD. So kann das Modell einen Block mit 16.000 Token laden, ohne ihn erneut berechnen zu müssen. Tests mit den Modellen Gemma 4 12B und 31B auf einer einzelnen NVIDIA H100 zeigten, dass das Laden bei einem Datenstrom mit 50 Millionen Token 2,8- bis 4,3-mal schneller war und 8,8- bis 12,3-mal weniger GPU-Energie verbrauchte. Das 31B-Modell beantwortete Faktenfragen zu früheren Textpassagen in 98 % der Fälle richtig.
Warum es wichtig ist
Entwickler können damit Anwendungen mit sehr langem Kontext auf einer einzelnen GPU ausführen und Kosten sowie Stromverbrauch senken.