Ett team lett av Arip Asadulaev har publicerat en metod som får språkmodeller att följa ett strikt utdataformat utan att kräva extra minne. Tekniken omvandlar formatet till en liten automat och kör maskeringen direkt på GPU:n. På en Apple M2 Pro med 16 GB slutförde modellerna Qwen‑3.5‑2B och 4B schemaanpassad informationsutvinning ungefär 1.2–1.3× snabbare. De använde bara 3 MB för en grammatik, jämfört med upp till 1.5 GB, och gjorde det möjligt för en server att hantera sexton grammatiker. Sexton parallella agenter som anropade verktyg slutförde sina uppgifter 2.5× snabbare.
Varför det spelar roll
Utvecklare kan köra fler AI-uppgifter med formatkrav på en enda laptop-GPU och spara både tid och minne.