Oossa

Ny inferensmetod snabbar upp språkmodeller med formatkrav

Forskare visar en minnessnål motor som gör JSON- och verktygsanrop 1.2–1.3× snabbare och minskar grammatikens storlek rejält.

NotisAv Publicerad av Oossa: 1 min läsning

Ett team lett av Arip Asadulaev har publicerat en metod som får språkmodeller att följa ett strikt utdataformat utan att kräva extra minne. Tekniken omvandlar formatet till en liten automat och kör maskeringen direkt på GPU:n. På en Apple M2 Pro med 16 GB slutförde modellerna Qwen‑3.5‑2B och 4B schemaanpassad informationsutvinning ungefär 1.2–1.3× snabbare. De använde bara 3 MB för en grammatik, jämfört med upp till 1.5 GB, och gjorde det möjligt för en server att hantera sexton grammatiker. Sexton parallella agenter som anropade verktyg slutförde sina uppgifter 2.5× snabbare.

Varför det spelar roll

Utvecklare kan köra fler AI-uppgifter med formatkrav på en enda laptop-GPU och spara både tid och minne.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.