Forschende haben APEX vorgestellt, einen trainierten Controller, der festlegt, wie viele Entwurfstokens generiert und welche Spekulationsmethode verwendet werden soll. APEX lässt sich in die Inferenz-Engine vLLM integrieren und wurde mit dem Sprachmodell Qwen3-8B getestet. Bei sechs Benchmark-Workloads erzielte APEX eine bis zu 5,24-fache Beschleunigung gegenüber dem standardmäßigen autoregressiven Decoding. Die Variante APEX-Depth hielt die Beschleunigung bei 3,27× und reduzierte die Zahl verworfener Tokens im Vergleich zu einem festen n‑Gramm-Entwurf der Größe 16 um 41 Prozent.
Warum es wichtig ist
Entwickler können große Sprachmodelle schneller und kostengünstiger betreiben. Dadurch werden KI-Funktionen in Echtzeit erschwinglicher.