Oossa

APEX से Qwen3-8B की डिकोडिंग 5.2× तक तेज़

नया APEX कंट्रोलर Qwen3-8B मॉडल का इन्फरेंस समय 5.24 गुना तक घटाता है और व्यर्थ ड्राफ्ट टोकन में 41% कमी लाता है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

शोधकर्ताओं ने APEX पेश किया है। यह एक प्रशिक्षित कंट्रोलर है, जो तय करता है कि कितने ड्राफ्ट टोकन जनरेट करने हैं और किस स्पेक्युलेशन तरीके का इस्तेमाल करना है। इसे vLLM इन्फरेंस इंजन में जोड़ा जा सकता है और Qwen3-8B भाषा मॉडल पर इसका परीक्षण किया गया। छह बेंचमार्क वर्कलोड में APEX ने सामान्य ऑटोरिग्रेसिव डिकोडिंग की तुलना में 5.24× तक तेज़ी हासिल की। APEX‑Depth वेरिएंट ने स्पीडअप 3.27× पर बनाए रखा और 16 के तय n‑gram ड्राफ्ट की तुलना में व्यर्थ टोकन 41% घटाए।

यह क्यों मायने रखता है

डेवलपर बड़े भाषा मॉडल को तेज़ी और कम लागत में चला सकते हैं, जिससे रियल-टाइम AI सुविधाएं अधिक किफायती होंगी।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।