پژوهشگران یک لایهٔ حافظهٔ عمومی به نام galahad‑kv منتشر کردهاند که وضعیت کلیدـمقدار یک مدل زبانی را روی دیسک محلی NVMe رمزگذاریشده ذخیره میکند. این ابزار به مدل امکان میدهد یک بلوک ۱۶٬۰۰۰توکنی را بدون محاسبهٔ دوباره بارگذاری کند. آزمایشها با مدلهای Gemma 4 12B و 31B روی یک NVIDIA H100 نشان داد که پردازش در جریانی با ۵۰ میلیون توکن، ۲.۸ تا ۴.۳ برابر سریعتر بود و ۸.۸ تا ۱۲.۳ برابر انرژی کمتری از GPU مصرف کرد. مدل 31B در ۹۸ درصد موارد به پرسشهای factual دربارهٔ بخشهای پیشین متن، پاسخ درست داد.
چرا مهم است
این ابزار به توسعهدهندگان امکان میدهد برنامههای دارای بافت بسیار طولانی را روی یک GPU اجرا کنند و هزینه و مصرف برق را کاهش دهند.