Een team onder leiding van Arip Asadulaev publiceerde een methode waarmee taalmodellen een strikt uitvoerformaat volgen zonder extra geheugen te gebruiken. De techniek zet het formaat om in een kleine automaat en past het masker rechtstreeks toe op de GPU. Op een Apple M2 Pro met 16 GB rondde de Qwen-3.5-2B- en 4B-modellen extractietaken met een vast schema ongeveer 1,2–1,3× sneller af. Daarbij gebruikten ze slechts 3 MB voor een grammatica, in plaats van maximaal 1,5 GB, en kon een server zestien grammatica's hosten. Zestien parallel werkende agents die tools aanroepen, klaarden hun taken 2,5× sneller.
Waarom het ertoe doet
Ontwikkelaars kunnen meer AI-taken met vaste uitvoerformaten uitvoeren op één laptop-GPU en besparen zo tijd en geheugen.