گروهی به سرپرستی آهان گوپتا معماری تازهای به نام Universal Attention معرفی کردهاند. این معماری از کدگذاریهای مکانی RoPE و سازوکار توجه Softmax معمول استفاده میکند، اما سازوکاری آموزشپذیر برای کاهش وزن میافزاید که هنگام استنتاج تعیین میکند کدام توکنها حذف شوند. این روش، حافظهٔ کلیدـمقدار یا KV-cache را ــ بخشی از حافظهای که مدلهای زبانی بزرگ استفاده میکنند ــ بدون افت دقت هرس میکند. آزمایشها نشان میدهند که اندازهٔ کش در دادههای معمول ۱۰ برابر و هنگام پردازش ورودیهای ۱۶٬۰۰۰ توکنی ۲۵ برابر کاهش مییابد و در عین حال عملکرد در کارهای بعدی هم بهتر میشود.
چرا مهم است
نیاز کمتر به حافظهٔ کش میتواند اجرای مدلهای زبانی بزرگ را روی دستگاههای کمحافظه ارزانتر و سریعتر کند.