# ترنسفورمرِ خودهرس‌شونده، حجم KV-cache را تا ۲۵ برابر کم می‌کند

> پژوهشگران روش آموزش‌پذیر Universal Attention را معرفی کرده‌اند که توکن‌های کم‌اثر را به‌طور تطبیقی حذف می‌کند؛ این روش در کارهای معمول فشرده‌سازی ۱۰ برابری و برای دنباله‌های ۱۶هزار توکنی فشرده‌سازی ۲۵ برابری به دست می‌دهد.

Oossa · 2026-10-08 · https://oossa.com/fa/self-pruning-transformer-cuts-kv-cache-size-up-to-25

گروهی به سرپرستی آهان گوپتا معماری تازه‌ای به نام Universal Attention معرفی کرده‌اند. این معماری از کدگذاری‌های مکانی RoPE و سازوکار توجه Softmax معمول استفاده می‌کند، اما سازوکاری آموزش‌پذیر برای کاهش وزن می‌افزاید که هنگام استنتاج تعیین می‌کند کدام توکن‌ها حذف شوند. این روش، حافظهٔ کلیدـمقدار یا KV-cache را ــ بخشی از حافظه‌ای که مدل‌های زبانی بزرگ استفاده می‌کنند ــ بدون افت دقت هرس می‌کند. آزمایش‌ها نشان می‌دهند که اندازهٔ کش در داده‌های معمول ۱۰ برابر و هنگام پردازش ورودی‌های ۱۶٬۰۰۰ توکنی ۲۵ برابر کاهش می‌یابد و در عین حال عملکرد در کارهای بعدی هم بهتر می‌شود.

## حقایق

- فشرده‌سازی KV-cache به میزان ۱۰ برابر در کارهای پردازش زبان طبیعی
- فشرده‌سازی ۲۵ برابری برای دنباله‌های ۱۶هزار توکنی

## چرا مهم است

نیاز کمتر به حافظهٔ کش می‌تواند اجرای مدل‌های زبانی بزرگ را روی دستگاه‌های کم‌حافظه ارزان‌تر و سریع‌تر کند.

## منابع و ارجاع‌ها

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

آخرین به‌روزرسانی: 2026-10-08
