# Neue Inferenzmethode beschleunigt formatgebundene Modellausgaben

> Ein speichersparender Ansatz macht die Generierung von JSON und Tool-Aufrufen 1,2–1,3× schneller und verkleinert Grammatiken drastisch.

Oossa · 2026-10-08 · https://oossa.com/de/new-inference-method-speeds-up-schema-constrained-language-model-output

Ein Team unter der Leitung von Arip Asadulaev hat eine Methode veröffentlicht, mit der Sprachmodelle ein striktes Ausgabeformat einhalten – ohne zusätzlichen Speicherbedarf. Dazu wird das Format in einen kleinen Automaten umgewandelt, der die Einschränkungsmaske direkt auf der GPU anwendet. Auf einem Apple M2 Pro mit 16 GB führten die Modelle Qwen‑3.5‑2B und 4B die schema-konforme Extraktion etwa 1,2–1,3× schneller aus. Dabei benötigten sie für eine Grammatik nur 3 MB statt bis zu 1,5 GB, sodass ein Server sechzehn Grammatiken vorhalten konnte. Sechzehn parallel arbeitende Agenten für Tool-Aufrufe erledigten ihre Aufgaben 2,5× schneller.

## Die Fakten

- Veröffentlicht: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Geschwindigkeitssteigerung: Extraktion 1,2–1,3× schneller; Tool-Agenten 2,5× schneller; Grammatikgröße: 3 MB statt 1,5 GB

## Warum es wichtig ist

Entwickler können mehr Aufgaben mit eingeschränkten KI-Ausgaben auf der GPU eines einzelnen Laptops ausführen und dabei Zeit und Speicher sparen.

## Quellen und Referenzen

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Zuletzt aktualisiert: 2026-10-08
