Oossa

ترنسفورمرِ خودهرس‌شونده، حجم KV-cache را تا ۲۵ برابر کم می‌کند

پژوهشگران روش آموزش‌پذیر Universal Attention را معرفی کرده‌اند که توکن‌های کم‌اثر را به‌طور تطبیقی حذف می‌کند؛ این روش در کارهای معمول فشرده‌سازی ۱۰ برابری و برای دنباله‌های ۱۶هزار توکنی فشرده‌سازی ۲۵ برابری به دست می‌دهد.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

گروهی به سرپرستی آهان گوپتا معماری تازه‌ای به نام Universal Attention معرفی کرده‌اند. این معماری از کدگذاری‌های مکانی RoPE و سازوکار توجه Softmax معمول استفاده می‌کند، اما سازوکاری آموزش‌پذیر برای کاهش وزن می‌افزاید که هنگام استنتاج تعیین می‌کند کدام توکن‌ها حذف شوند. این روش، حافظهٔ کلیدـمقدار یا KV-cache را ــ بخشی از حافظه‌ای که مدل‌های زبانی بزرگ استفاده می‌کنند ــ بدون افت دقت هرس می‌کند. آزمایش‌ها نشان می‌دهند که اندازهٔ کش در داده‌های معمول ۱۰ برابر و هنگام پردازش ورودی‌های ۱۶٬۰۰۰ توکنی ۲۵ برابر کاهش می‌یابد و در عین حال عملکرد در کارهای بعدی هم بهتر می‌شود.

چرا مهم است

نیاز کمتر به حافظهٔ کش می‌تواند اجرای مدل‌های زبانی بزرگ را روی دستگاه‌های کم‌حافظه ارزان‌تر و سریع‌تر کند.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.