Oossa

Speicherschicht macht 50 Millionen Token schneller und günstiger nutzbar

Das Paket galahad‑kv speichert den KV-Zustand verschlüsselt auf einer NVMe-SSD. Bei langen Texten sinkt die Rechenzeit um das 2,8- bis 4,3-Fache und der Energieverbrauch um das 8,8- bis 12,3-Fache.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Forschende haben eine öffentlich verfügbare Speicherschicht namens galahad‑kv vorgestellt. Sie speichert den Key-Value-Zustand eines Sprachmodells auf einer verschlüsselten lokalen NVMe-SSD. So kann das Modell einen Block mit 16.000 Token laden, ohne ihn erneut berechnen zu müssen. Tests mit den Modellen Gemma 4 12B und 31B auf einer einzelnen NVIDIA H100 zeigten, dass das Laden bei einem Datenstrom mit 50 Millionen Token 2,8- bis 4,3-mal schneller war und 8,8- bis 12,3-mal weniger GPU-Energie verbrauchte. Das 31B-Modell beantwortete Faktenfragen zu früheren Textpassagen in 98 % der Fälle richtig.

Warum es wichtig ist

Entwickler können damit Anwendungen mit sehr langem Kontext auf einer einzelnen GPU ausführen und Kosten sowie Stromverbrauch senken.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.