# آلية تقليم ذاتية تقلّص ذاكرة KV حتى 25 مرة

> يقدّم باحثون آلية Universal Attention، وهي طريقة قابلة للتدريب تحذف تدريجيًا الرموز الأقل تأثيرًا، وتقلّص الذاكرة 10 مرات في المهام المعتادة و25 مرة عند معالجة تسلسلات من 16k رمز.

Oossa · 2026-10-08 · https://oossa.com/ar/self-pruning-transformer-cuts-kv-cache-size-up-to-25

قدّم فريق بقيادة أهان غوبتا بنية جديدة تُسمى Universal Attention. وهي تُبقي على تضمينات المواضع القياسية RoPE وآلية الانتباه Softmax، لكنها تضيف آلية اضمحلال قابلة للتدريب تحدد الرموز التي ينبغي حذفها أثناء الاستدلال. وتقلّم الطريقة ذاكرة المفاتيح والقيم (KV cache)، وهي الذاكرة التي تستخدمها نماذج اللغة الكبيرة، من دون التأثير سلبًا في الدقة. وأظهرت الاختبارات تقليص حجم الذاكرة عشرة أضعاف مع البيانات المعتادة، و25 ضعفًا عند معالجة مدخلات بطول 16,000 رمز، مع تحسين الأداء في المهام اللاحقة.

## الحقائق

- ضغط ذاكرة KV بمقدار 10 أضعاف في مهام اللغة الطبيعية
- ضغط بمقدار 25 ضعفًا عند طول 16k رمز

## لماذا يهم

تتيح الحاجة إلى ذاكرة أصغر تشغيل نماذج اللغة الكبيرة بتكلفة أقل وسرعة أعلى على الأجهزة محدودة الذاكرة.

## المصادر والمراجع

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

آخر تحديث: 2026-10-08
