I ricercatori hanno presentato APEX, un controller basato sull’apprendimento automatico che decide quanti token di bozza generare e quale metodo di speculazione usare. Si integra con il motore di inferenza vLLM ed è stato testato sul modello linguistico Qwen3-8B. Su sei carichi di lavoro di benchmark, APEX ha ottenuto una velocità fino a 5,24× superiore rispetto alla decodifica autoregressiva standard. La variante APEX-Depth ha mantenuto un’accelerazione di 3,27×, riducendo del 41% i token sprecati rispetto a una bozza n-gram fissa di dimensione 16.
Perché conta
Gli sviluppatori possono eseguire modelli linguistici di grandi dimensioni più velocemente e a costi inferiori, rendendo più accessibili le funzionalità di IA in tempo reale.