# Un nuovo metodo accelera la generazione vincolata degli LLM

> I ricercatori presentano un motore a basso consumo di memoria che genera JSON e chiamate agli strumenti da 1,2 a 1,3 volte più velocemente e riduce drasticamente le dimensioni delle grammatiche.

Oossa · 2026-10-08 · https://oossa.com/it/new-inference-method-speeds-up-schema-constrained-language-model-output

Un team guidato da Arip Asadulaev ha pubblicato un metodo che impone ai modelli linguistici di rispettare un formato di output rigoroso senza richiedere memoria aggiuntiva. La tecnica rappresenta il formato come un automa compatto e applica direttamente la maschera sulla GPU. Su un Apple M2 Pro da 16 GB, i modelli Qwen‑3.5‑2B e 4B hanno completato l’estrazione vincolata da schema da 1,2 a 1,3 volte più velocemente. Per una grammatica hanno usato appena 3 MB, contro un massimo di 1,5 GB, e hanno permesso a un server di ospitarne sedici. Sedici agenti paralleli che chiamavano strumenti hanno completato le loro attività in un tempo 2,5 volte inferiore.

## I fatti

- Pubblicato: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Accelerazione: estrazione da 1,2 a 1,3 volte più veloce; agenti che usano strumenti 2,5 volte più veloci; grammatica da 3 MB contro 1,5 GB

## Perché conta

Gli sviluppatori possono eseguire più attività di IA vincolate su un’unica GPU per laptop, risparmiando tempo e memoria.

## Fonti e riferimenti

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Ultimo aggiornamento: 2026-10-08
