Oossa

لایه حافظه، استفاده دوباره از بافت ۵۰میلیون‌توکنی را سریع‌تر و ارزان‌تر می‌کند

بستهٔ galahad‑kv وضعیت KV را روی حافظهٔ NVMe رمزگذاری‌شده ذخیره می‌کند و زمان پردازش را ۲.۸ تا ۴.۳ برابر و مصرف انرژی را ۸.۸ تا ۱۲.۳ برابر کاهش می‌دهد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پژوهشگران یک لایهٔ حافظهٔ عمومی به نام galahad‑kv منتشر کرده‌اند که وضعیت کلیدـمقدار یک مدل زبانی را روی دیسک محلی NVMe رمزگذاری‌شده ذخیره می‌کند. این ابزار به مدل امکان می‌دهد یک بلوک ۱۶٬۰۰۰توکنی را بدون محاسبهٔ دوباره بارگذاری کند. آزمایش‌ها با مدل‌های Gemma 4 12B و 31B روی یک NVIDIA H100 نشان داد که پردازش در جریانی با ۵۰ میلیون توکن، ۲.۸ تا ۴.۳ برابر سریع‌تر بود و ۸.۸ تا ۱۲.۳ برابر انرژی کمتری از GPU مصرف کرد. مدل 31B در ۹۸ درصد موارد به پرسش‌های factual دربارهٔ بخش‌های پیشین متن، پاسخ درست داد.

چرا مهم است

این ابزار به توسعه‌دهندگان امکان می‌دهد برنامه‌های دارای بافت بسیار طولانی را روی یک GPU اجرا کنند و هزینه و مصرف برق را کاهش دهند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.