Des chercheurs ont présenté APEX, un contrôleur entraîné qui détermine le nombre de jetons de brouillon à générer et la méthode de spéculation à utiliser. Intégré au moteur d’inférence vLLM, il a été testé sur le modèle de langage Qwen3-8B. Sur six charges de travail de référence, APEX a atteint une accélération pouvant aller jusqu’à 5,24× par rapport au décodage autorégressif standard. La variante APEX‑Depth a conservé une accélération de 3,27× tout en réduisant de 41 % le nombre de jetons inutilisés, par rapport à un brouillon n‑gramme fixe de taille 16.
Pourquoi c'est important
Les développeurs peuvent exécuter plus rapidement et à moindre coût de grands modèles de langage, ce qui rend les fonctionnalités d’IA en temps réel plus abordables.