# لایه حافظه، استفاده دوباره از بافت ۵۰میلیون‌توکنی را سریع‌تر و ارزان‌تر می‌کند

> بستهٔ galahad‑kv وضعیت KV را روی حافظهٔ NVMe رمزگذاری‌شده ذخیره می‌کند و زمان پردازش را ۲.۸ تا ۴.۳ برابر و مصرف انرژی را ۸.۸ تا ۱۲.۳ برابر کاهش می‌دهد.

Oossa · 2026-10-09 · https://oossa.com/fa/memory-layer-lets-ai-reuse-50-million-token-context-faster-and-cheaper

پژوهشگران یک لایهٔ حافظهٔ عمومی به نام galahad‑kv منتشر کرده‌اند که وضعیت کلیدـمقدار یک مدل زبانی را روی دیسک محلی NVMe رمزگذاری‌شده ذخیره می‌کند. این ابزار به مدل امکان می‌دهد یک بلوک ۱۶٬۰۰۰توکنی را بدون محاسبهٔ دوباره بارگذاری کند. آزمایش‌ها با مدل‌های Gemma 4 12B و 31B روی یک NVIDIA H100 نشان داد که پردازش در جریانی با ۵۰ میلیون توکن، ۲.۸ تا ۴.۳ برابر سریع‌تر بود و ۸.۸ تا ۱۲.۳ برابر انرژی کمتری از GPU مصرف کرد. مدل 31B در ۹۸ درصد موارد به پرسش‌های factual دربارهٔ بخش‌های پیشین متن، پاسخ درست داد.

## حقایق

- لایهٔ حافظه وضعیت KV بلوک‌های ۱۶٬۰۰۰توکنی را روی NVMe رمزگذاری‌شده ذخیره می‌کند.
- بارگذاری یک بلوک ۲.۸ تا ۴.۳ برابر سریع‌تر بود و ۸.۸ تا ۱۲.۳ برابر انرژی کمتری از GPU مصرف کرد.

## چرا مهم است

این ابزار به توسعه‌دهندگان امکان می‌دهد برنامه‌های دارای بافت بسیار طولانی را روی یک GPU اجرا کنند و هزینه و مصرف برق را کاهش دهند.

## منابع و ارجاع‌ها

1. [Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute](https://arxiv.org/abs/2610.10845) – arXiv, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
