Oossa

Neue Inferenzmethode beschleunigt formatgebundene Modellausgaben

Ein speichersparender Ansatz macht die Generierung von JSON und Tool-Aufrufen 1,2–1,3× schneller und verkleinert Grammatiken drastisch.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Ein Team unter der Leitung von Arip Asadulaev hat eine Methode veröffentlicht, mit der Sprachmodelle ein striktes Ausgabeformat einhalten – ohne zusätzlichen Speicherbedarf. Dazu wird das Format in einen kleinen Automaten umgewandelt, der die Einschränkungsmaske direkt auf der GPU anwendet. Auf einem Apple M2 Pro mit 16 GB führten die Modelle Qwen‑3.5‑2B und 4B die schema-konforme Extraktion etwa 1,2–1,3× schneller aus. Dabei benötigten sie für eine Grammatik nur 3 MB statt bis zu 1,5 GB, sodass ein Server sechzehn Grammatiken vorhalten konnte. Sechzehn parallel arbeitende Agenten für Tool-Aufrufe erledigten ihre Aufgaben 2,5× schneller.

Warum es wichtig ist

Entwickler können mehr Aufgaben mit eingeschränkten KI-Ausgaben auf der GPU eines einzelnen Laptops ausführen und dabei Zeit und Speicher sparen.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.