शोधकर्ताओं ने galahad‑kv नाम की एक सार्वजनिक मेमोरी लेयर जारी की है, जो भाषा मॉडल की की-वैल्यू (KV) स्टेट को एन्क्रिप्टेड लोकल NVMe डिस्क पर सहेजती है। इससे मॉडल 16,000‑टोकन वाले ब्लॉक को दोबारा गणना किए बिना फिर से लोड कर सकता है। Gemma 4 12B और 31B मॉडल के साथ एक NVIDIA H100 पर किए गए परीक्षणों में, 50 मिलियन टोकन की स्ट्रीम के दौरान ब्लॉक लोड करना 2.8‑4.3 गुना तेज़ रहा और GPU ऊर्जा की खपत 8.8‑12.3 गुना कम हुई। 31B मॉडल ने टेक्स्ट के पहले के हिस्सों से जुड़े तथ्यात्मक सवालों के सही जवाब 98 % बार दिए।
यह क्यों मायने रखता है
इससे डेवलपर एक ही GPU पर बहुत लंबे संदर्भ वाले ऐप चला सकते हैं और लागत तथा बिजली की खपत घटा सकते हैं।