शोधकर्ताओं ने APEX पेश किया है। यह एक प्रशिक्षित कंट्रोलर है, जो तय करता है कि कितने ड्राफ्ट टोकन जनरेट करने हैं और किस स्पेक्युलेशन तरीके का इस्तेमाल करना है। इसे vLLM इन्फरेंस इंजन में जोड़ा जा सकता है और Qwen3-8B भाषा मॉडल पर इसका परीक्षण किया गया। छह बेंचमार्क वर्कलोड में APEX ने सामान्य ऑटोरिग्रेसिव डिकोडिंग की तुलना में 5.24× तक तेज़ी हासिल की। APEX‑Depth वेरिएंट ने स्पीडअप 3.27× पर बनाए रखा और 16 के तय n‑gram ड्राफ्ट की तुलना में व्यर्थ टोकन 41% घटाए।
यह क्यों मायने रखता है
डेवलपर बड़े भाषा मॉडल को तेज़ी और कम लागत में चला सकते हैं, जिससे रियल-टाइम AI सुविधाएं अधिक किफायती होंगी।