Oossa

Un nuovo metodo accelera la generazione vincolata degli LLM

I ricercatori presentano un motore a basso consumo di memoria che genera JSON e chiamate agli strumenti da 1,2 a 1,3 volte più velocemente e riduce drasticamente le dimensioni delle grammatiche.

BreveDi Pubblicato da Oossa: 1 min di lettura

Un team guidato da Arip Asadulaev ha pubblicato un metodo che impone ai modelli linguistici di rispettare un formato di output rigoroso senza richiedere memoria aggiuntiva. La tecnica rappresenta il formato come un automa compatto e applica direttamente la maschera sulla GPU. Su un Apple M2 Pro da 16 GB, i modelli Qwen‑3.5‑2B e 4B hanno completato l’estrazione vincolata da schema da 1,2 a 1,3 volte più velocemente. Per una grammatica hanno usato appena 3 MB, contro un massimo di 1,5 GB, e hanno permesso a un server di ospitarne sedici. Sedici agenti paralleli che chiamavano strumenti hanno completato le loro attività in un tempo 2,5 volte inferiore.

Perché conta

Gli sviluppatori possono eseguire più attività di IA vincolate su un’unica GPU per laptop, risparmiando tempo e memoria.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.