Oossa

नई तकनीक से भाषा मॉडल का आउटपुट 1.2–1.3× तेज़

शोधकर्ताओं ने कम मेमरी वाला इंजन पेश किया है, जो JSON और टूल-कॉल जनरेशन को 1.2–1.3× तेज़ करता है और ग्रामर का आकार बहुत घटाता है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Arip Asadulaev की अगुवाई वाली टीम ने ऐसी विधि प्रकाशित की है, जो भाषा मॉडल को अतिरिक्त मेमरी के बिना तय आउटपुट फ़ॉर्मैट का सख्ती से पालन कराती है। इस तकनीक में फ़ॉर्मैट को एक छोटे ऑटोमेटन के रूप में बदला जाता है और मास्क सीधे GPU पर चलाया जाता है। 16 GB Apple M2 Pro पर Qwen‑3.5‑2B और 4B मॉडल ने स्कीमा के मुताबिक डेटा निकालने का काम लगभग 1.2–1.3× तेज़ी से पूरा किया। उन्होंने ग्रामर के लिए 1.5 GB तक की जगह के बजाय सिर्फ़ 3 MB मेमरी इस्तेमाल की और एक सर्वर पर सोलह ग्रामर होस्ट करना संभव बनाया। समानांतर चल रहे सोलह टूल-कॉलिंग एजेंटों ने अपने काम 2.5× कम समय में पूरे किए।

यह क्यों मायने रखता है

डेवलपर एक ही लैपटॉप GPU पर ज़्यादा सीमित फ़ॉर्मैट वाले AI काम चला सकते हैं और समय व मेमरी बचा सकते हैं।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।