Forskare har presenterat APEX, en inlärd styrenhet som väljer hur många utkasttoken som ska genereras och vilken spekulationsmetod som ska användas. Den integreras med inferensmotorn vLLM och testades på språkmodellen Qwen3-8B. I sex benchmarktester uppnådde APEX upp till 5,24× högre hastighet än standardavkodning med autoregressiv metod. Varianten APEX‑Depth behöll en hastighetsökning på 3,27× och minskade samtidigt mängden oanvända token med 41% jämfört med ett fast n‑gram-utkast med storlek 16.
Varför det spelar roll
Utvecklare kan köra stora språkmodeller snabbare och billigare, vilket gör AI-funktioner i realtid mer överkomliga.