Onderzoekers introduceerden APEX, een lerende controller die bepaalt hoeveel concepttokens er worden gegenereerd en welke speculatiemethode wordt gebruikt. APEX werkt met de vLLM-inferentie-engine en is getest op het taalmodel Qwen3-8B. Op zes benchmarktaken behaalde APEX een versnelling tot 5,24× ten opzichte van standaard autoregressieve decodering. De variant APEX‑Depth behield een versnelling van 3,27× en verminderde het aantal verspilde tokens met 41% vergeleken met een vaste n‑gram-conceptaanvulling met grootte 16.
Waarom het ertoe doet
Ontwikkelaars kunnen grote taalmodellen sneller en goedkoper draaien, waardoor AI-functies in realtime betaalbaarder worden.