Oossa

آلية تقليم ذاتية تقلّص ذاكرة KV حتى 25 مرة

يقدّم باحثون آلية Universal Attention، وهي طريقة قابلة للتدريب تحذف تدريجيًا الرموز الأقل تأثيرًا، وتقلّص الذاكرة 10 مرات في المهام المعتادة و25 مرة عند معالجة تسلسلات من 16k رمز.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

قدّم فريق بقيادة أهان غوبتا بنية جديدة تُسمى Universal Attention. وهي تُبقي على تضمينات المواضع القياسية RoPE وآلية الانتباه Softmax، لكنها تضيف آلية اضمحلال قابلة للتدريب تحدد الرموز التي ينبغي حذفها أثناء الاستدلال. وتقلّم الطريقة ذاكرة المفاتيح والقيم (KV cache)، وهي الذاكرة التي تستخدمها نماذج اللغة الكبيرة، من دون التأثير سلبًا في الدقة. وأظهرت الاختبارات تقليص حجم الذاكرة عشرة أضعاف مع البيانات المعتادة، و25 ضعفًا عند معالجة مدخلات بطول 16,000 رمز، مع تحسين الأداء في المهام اللاحقة.

لماذا يهم

تتيح الحاجة إلى ذاكرة أصغر تشغيل نماذج اللغة الكبيرة بتكلفة أقل وسرعة أعلى على الأجهزة محدودة الذاكرة.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.