# Nieuwe inferentiemethode versnelt uitvoer van taalmodellen met schema's

> Onderzoekers presenteren een engine die weinig geheugen gebruikt en JSON- en toolaanroepen 1,2–1,3× sneller genereert, terwijl grammaticabestanden veel kleiner worden.

Oossa · 2026-10-08 · https://oossa.com/nl/new-inference-method-speeds-up-schema-constrained-language-model-output

Een team onder leiding van Arip Asadulaev publiceerde een methode waarmee taalmodellen een strikt uitvoerformaat volgen zonder extra geheugen te gebruiken. De techniek zet het formaat om in een kleine automaat en past het masker rechtstreeks toe op de GPU. Op een Apple M2 Pro met 16 GB rondde de Qwen-3.5-2B- en 4B-modellen extractietaken met een vast schema ongeveer 1,2–1,3× sneller af. Daarbij gebruikten ze slechts 3 MB voor een grammatica, in plaats van maximaal 1,5 GB, en kon een server zestien grammatica's hosten. Zestien parallel werkende agents die tools aanroepen, klaarden hun taken 2,5× sneller.

## De feiten

- Gepubliceerd: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Snelheidswinst: extractie 1,2–1,3× sneller; toolagents 2,5× sneller; grammaticagrootte 3 MB tegenover 1,5 GB

## Waarom het ertoe doet

Ontwikkelaars kunnen meer AI-taken met vaste uitvoerformaten uitvoeren op één laptop-GPU en besparen zo tijd en geheugen.

## Bronnen en referenties

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Laatst bijgewerkt: 2026-10-08
