قدّم فريق بقيادة أهان غوبتا بنية جديدة تُسمى Universal Attention. وهي تُبقي على تضمينات المواضع القياسية RoPE وآلية الانتباه Softmax، لكنها تضيف آلية اضمحلال قابلة للتدريب تحدد الرموز التي ينبغي حذفها أثناء الاستدلال. وتقلّم الطريقة ذاكرة المفاتيح والقيم (KV cache)، وهي الذاكرة التي تستخدمها نماذج اللغة الكبيرة، من دون التأثير سلبًا في الدقة. وأظهرت الاختبارات تقليص حجم الذاكرة عشرة أضعاف مع البيانات المعتادة، و25 ضعفًا عند معالجة مدخلات بطول 16,000 رمز، مع تحسين الأداء في المهام اللاحقة.
لماذا يهم
تتيح الحاجة إلى ذاكرة أصغر تشغيل نماذج اللغة الكبيرة بتكلفة أقل وسرعة أعلى على الأجهزة محدودة الذاكرة.