# मेमोरी लेयर से 50 मिलियन टोकन का संदर्भ तेज़ और सस्ता

> galahad‑kv पैकेज एन्क्रिप्टेड NVMe पर KV स्टेट सहेजता है। लंबे टेक्स्ट के लिए इससे कंप्यूट समय 2.8‑4.3× और ऊर्जा की खपत 8.8‑12.3× कम होती है।

Oossa · 2026-10-09 · https://oossa.com/hi/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

शोधकर्ताओं ने galahad‑kv नाम की एक सार्वजनिक मेमोरी लेयर जारी की है, जो भाषा मॉडल की की-वैल्यू (KV) स्टेट को एन्क्रिप्टेड लोकल NVMe डिस्क पर सहेजती है। इससे मॉडल 16,000‑टोकन वाले ब्लॉक को दोबारा गणना किए बिना फिर से लोड कर सकता है। Gemma 4 12B और 31B मॉडल के साथ एक NVIDIA H100 पर किए गए परीक्षणों में, 50 मिलियन टोकन की स्ट्रीम के दौरान ब्लॉक लोड करना 2.8‑4.3 गुना तेज़ रहा और GPU ऊर्जा की खपत 8.8‑12.3 गुना कम हुई। 31B मॉडल ने टेक्स्ट के पहले के हिस्सों से जुड़े तथ्यात्मक सवालों के सही जवाब 98 % बार दिए।

## तथ्य

- मेमोरी लेयर एन्क्रिप्टेड NVMe पर 16,000‑टोकन ब्लॉक की KV स्टेट सहेजती है।
- ब्लॉक लोड करना 2.8×‑4.3× तेज़ रहा और GPU ऊर्जा की खपत 8.8×‑12.3× कम हुई।

## यह क्यों मायने रखता है

इससे डेवलपर एक ही GPU पर बहुत लंबे संदर्भ वाले ऐप चला सकते हैं और लागत तथा बिजली की खपत घटा सकते हैं।

## स्रोत और संदर्भ

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

अंतिम अपडेट: 2026-10-09
