Oossa

Nieuwe inferentiemethode versnelt uitvoer van taalmodellen met schema's

Onderzoekers presenteren een engine die weinig geheugen gebruikt en JSON- en toolaanroepen 1,2–1,3× sneller genereert, terwijl grammaticabestanden veel kleiner worden.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Arip Asadulaev publiceerde een methode waarmee taalmodellen een strikt uitvoerformaat volgen zonder extra geheugen te gebruiken. De techniek zet het formaat om in een kleine automaat en past het masker rechtstreeks toe op de GPU. Op een Apple M2 Pro met 16 GB rondde de Qwen-3.5-2B- en 4B-modellen extractietaken met een vast schema ongeveer 1,2–1,3× sneller af. Daarbij gebruikten ze slechts 3 MB voor een grammatica, in plaats van maximaal 1,5 GB, en kon een server zestien grammatica's hosten. Zestien parallel werkende agents die tools aanroepen, klaarden hun taken 2,5× sneller.

Waarom het ertoe doet

Ontwikkelaars kunnen meer AI-taken met vaste uitvoerformaten uitvoeren op één laptop-GPU en besparen zo tijd en geheugen.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.