Oossa

APEX snabbar upp Qwen3-8B-avkodning med upp till 5,2×

Den nya APEX-styrenheten minskar inferenstiden för modellen Qwen3-8B med upp till 5,24 gånger och minskar samtidigt mängden oanvända utkasttoken med 41%.

NotisAv Publicerad av Oossa: 1 min läsning

Forskare har presenterat APEX, en inlärd styrenhet som väljer hur många utkasttoken som ska genereras och vilken spekulationsmetod som ska användas. Den integreras med inferensmotorn vLLM och testades på språkmodellen Qwen3-8B. I sex benchmarktester uppnådde APEX upp till 5,24× högre hastighet än standardavkodning med autoregressiv metod. Varianten APEX‑Depth behöll en hastighetsökning på 3,27× och minskade samtidigt mängden oanvända token med 41% jämfört med ett fast n‑gram-utkast med storlek 16.

Varför det spelar roll

Utvecklare kan köra stora språkmodeller snabbare och billigare, vilket gör AI-funktioner i realtid mer överkomliga.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.