# Ny inferensmetod snabbar upp språkmodeller med formatkrav

> Forskare visar en minnessnål motor som gör JSON- och verktygsanrop 1.2–1.3× snabbare och minskar grammatikens storlek rejält.

Oossa · 2026-10-08 · https://oossa.com/sv/new-inference-method-speeds-up-schema-constrained-language-model-output

Ett team lett av Arip Asadulaev har publicerat en metod som får språkmodeller att följa ett strikt utdataformat utan att kräva extra minne. Tekniken omvandlar formatet till en liten automat och kör maskeringen direkt på GPU:n. På en Apple M2 Pro med 16 GB slutförde modellerna Qwen‑3.5‑2B och 4B schemaanpassad informationsutvinning ungefär 1.2–1.3× snabbare. De använde bara 3 MB för en grammatik, jämfört med upp till 1.5 GB, och gjorde det möjligt för en server att hantera sexton grammatiker. Sexton parallella agenter som anropade verktyg slutförde sina uppgifter 2.5× snabbare.

## Fakta

- Publicerad: 2026-10-08 (”PUBLISHED: Thu Oct 08 2026”)
- Hastighetsökning: 1.2–1.3× snabbare informationsutvinning; verktygsagenter 2.5× snabbare; grammatikens storlek 3 MB jämfört med 1.5 GB

## Varför det spelar roll

Utvecklare kan köra fler AI-uppgifter med formatkrav på en enda laptop-GPU och spara både tid och minne.

## Källor och referenser

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Senast uppdaterad: 2026-10-08
