Ein Team unter der Leitung von Arip Asadulaev hat eine Methode veröffentlicht, mit der Sprachmodelle ein striktes Ausgabeformat einhalten – ohne zusätzlichen Speicherbedarf. Dazu wird das Format in einen kleinen Automaten umgewandelt, der die Einschränkungsmaske direkt auf der GPU anwendet. Auf einem Apple M2 Pro mit 16 GB führten die Modelle Qwen‑3.5‑2B und 4B die schema-konforme Extraktion etwa 1,2–1,3× schneller aus. Dabei benötigten sie für eine Grammatik nur 3 MB statt bis zu 1,5 GB, sodass ein Server sechzehn Grammatiken vorhalten konnte. Sechzehn parallel arbeitende Agenten für Tool-Aufrufe erledigten ihre Aufgaben 2,5× schneller.
Warum es wichtig ist
Entwickler können mehr Aufgaben mit eingeschränkten KI-Ausgaben auf der GPU eines einzelnen Laptops ausführen und dabei Zeit und Speicher sparen.