Ahan Gupta के नेतृत्व वाली टीम ने Universal Attention नाम का नया आर्किटेक्चर पेश किया। इसमें मानक RoPE पोज़िशनल एम्बेडिंग और Softmax अटेंशन बरकरार रहते हैं, लेकिन एक ट्रेन करने योग्य डिके मैकेनिज़्म जोड़ा गया है, जो तय करता है कि अनुमान के दौरान कौन-से टोकन हटाए जाएं। यह तरीका की-वैल्यू कैश को छोटा करता है—यही वह मेमोरी है जिसका इस्तेमाल बड़े भाषा मॉडल करते हैं—और सटीकता पर असर नहीं पड़ता। परीक्षणों में सामान्य डेटा पर कैश का आकार दस गुना और 16,000 टोकन वाले इनपुट पर पच्चीस गुना घटा, साथ ही आगे के कार्यों में प्रदर्शन बेहतर रहा।
यह क्यों मायने रखता है
कैश की कम ज़रूरत से सीमित मेमोरी वाले डिवाइसों पर बड़े भाषा मॉडल तैनात करना सस्ता और तेज़ हो सकता है।