# ट्रांसफॉर्मर खुद चुनता है कौन-से टोकन हटाने हैं, KV-कैश 25× तक घटा

> शोधकर्ताओं ने Universal Attention पेश किया है—एक ऐसा ट्रेन करने योग्य तरीका, जो कम असर वाले टोकन हटाता है। इससे सामान्य कामों में 10× और 16k टोकन वाले इनपुट पर 25× तक संपीड़न मिलता है।

Oossa · 2026-10-08 · https://oossa.com/hi/self-pruning-transformer-cuts-kv-cache-size-up-to-25

Ahan Gupta के नेतृत्व वाली टीम ने Universal Attention नाम का नया आर्किटेक्चर पेश किया। इसमें मानक RoPE पोज़िशनल एम्बेडिंग और Softmax अटेंशन बरकरार रहते हैं, लेकिन एक ट्रेन करने योग्य डिके मैकेनिज़्म जोड़ा गया है, जो तय करता है कि अनुमान के दौरान कौन-से टोकन हटाए जाएं। यह तरीका की-वैल्यू कैश को छोटा करता है—यही वह मेमोरी है जिसका इस्तेमाल बड़े भाषा मॉडल करते हैं—और सटीकता पर असर नहीं पड़ता। परीक्षणों में सामान्य डेटा पर कैश का आकार दस गुना और 16,000 टोकन वाले इनपुट पर पच्चीस गुना घटा, साथ ही आगे के कार्यों में प्रदर्शन बेहतर रहा।

## तथ्य

- प्राकृतिक भाषा से जुड़े कामों में KV-कैश का 10× संपीड़न
- 16k टोकन की लंबाई पर 25× संपीड़न

## यह क्यों मायने रखता है

कैश की कम ज़रूरत से सीमित मेमोरी वाले डिवाइसों पर बड़े भाषा मॉडल तैनात करना सस्ता और तेज़ हो सकता है।

## स्रोत और संदर्भ

1. [A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention](https://arxiv.org/abs/2610.09051) – arXiv cs.LG, 2026-10-08

अंतिम अपडेट: 2026-10-08
