Oossa

APEX beschleunigt Qwen3-8B-Decoding um bis zu 5,2×

Der neue APEX-Controller verkürzt die Inferenzzeit des Modells Qwen3-8B um bis zu das 5,24-Fache und reduziert zugleich die Zahl verworfener Entwurfstokens um 41 Prozent.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Forschende haben APEX vorgestellt, einen trainierten Controller, der festlegt, wie viele Entwurfstokens generiert und welche Spekulationsmethode verwendet werden soll. APEX lässt sich in die Inferenz-Engine vLLM integrieren und wurde mit dem Sprachmodell Qwen3-8B getestet. Bei sechs Benchmark-Workloads erzielte APEX eine bis zu 5,24-fache Beschleunigung gegenüber dem standardmäßigen autoregressiven Decoding. Die Variante APEX-Depth hielt die Beschleunigung bei 3,27× und reduzierte die Zahl verworfener Tokens im Vergleich zu einem festen n‑Gramm-Entwurf der Größe 16 um 41 Prozent.

Warum es wichtig ist

Entwickler können große Sprachmodelle schneller und kostengünstiger betreiben. Dadurch werden KI-Funktionen in Echtzeit erschwinglicher.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.