أطلق باحثون طبقة ذاكرة عامة باسم galahad‑kv، تحفظ حالة المفتاح والقيمة (KV) الخاصة بالنموذج اللغوي على قرص NVMe محلي مشفّر. وتتيح للنموذج إعادة تحميل كتلة من 16,000 رمز من دون إعادة احتسابها. وأظهرت اختبارات أُجريت على وحدة NVIDIA H100 واحدة باستخدام نموذجي Gemma 4 12B و31B أن التحميل كان أسرع بمقدار 2.8‑4.3 مرة، واستهلك طاقة أقل من وحدة GPU بمقدار 8.8‑12.3 مرة، ضمن تدفق من 50 million رمز. وأجاب نموذج 31B إجابة صحيحة عن الأسئلة الواقعية المتعلقة بأجزاء سابقة من النص في 98 % من المرات.
لماذا يهم
تتيح للمطورين تشغيل تطبيقات ذات سياق طويل جداً على وحدة GPU واحدة، مع خفض التكلفة واستهلاك الطاقة.