# नई तकनीक से भाषा मॉडल का आउटपुट 1.2–1.3× तेज़

> शोधकर्ताओं ने कम मेमरी वाला इंजन पेश किया है, जो JSON और टूल-कॉल जनरेशन को 1.2–1.3× तेज़ करता है और ग्रामर का आकार बहुत घटाता है।

Oossa · 2026-10-08 · https://oossa.com/hi/new-inference-method-speeds-up-schema-constrained-language-model-output

Arip Asadulaev की अगुवाई वाली टीम ने ऐसी विधि प्रकाशित की है, जो भाषा मॉडल को अतिरिक्त मेमरी के बिना तय आउटपुट फ़ॉर्मैट का सख्ती से पालन कराती है। इस तकनीक में फ़ॉर्मैट को एक छोटे ऑटोमेटन के रूप में बदला जाता है और मास्क सीधे GPU पर चलाया जाता है। 16 GB Apple M2 Pro पर Qwen‑3.5‑2B और 4B मॉडल ने स्कीमा के मुताबिक डेटा निकालने का काम लगभग 1.2–1.3× तेज़ी से पूरा किया। उन्होंने ग्रामर के लिए 1.5 GB तक की जगह के बजाय सिर्फ़ 3 MB मेमरी इस्तेमाल की और एक सर्वर पर सोलह ग्रामर होस्ट करना संभव बनाया। समानांतर चल रहे सोलह टूल-कॉलिंग एजेंटों ने अपने काम 2.5× कम समय में पूरे किए।

## तथ्य

- प्रकाशित: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- तेज़ी: डेटा निकालने में 1.2–1.3× तेज़; टूल एजेंट 2.5× तेज़; ग्रामर का आकार 3 MB बनाम 1.5 GB

## यह क्यों मायने रखता है

डेवलपर एक ही लैपटॉप GPU पर ज़्यादा सीमित फ़ॉर्मैट वाले AI काम चला सकते हैं और समय व मेमरी बचा सकते हैं।

## स्रोत और संदर्भ

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

अंतिम अपडेट: 2026-10-08
