Un team guidato da Arip Asadulaev ha pubblicato un metodo che impone ai modelli linguistici di rispettare un formato di output rigoroso senza richiedere memoria aggiuntiva. La tecnica rappresenta il formato come un automa compatto e applica direttamente la maschera sulla GPU. Su un Apple M2 Pro da 16 GB, i modelli Qwen‑3.5‑2B e 4B hanno completato l’estrazione vincolata da schema da 1,2 a 1,3 volte più velocemente. Per una grammatica hanno usato appena 3 MB, contro un massimo di 1,5 GB, e hanno permesso a un server di ospitarne sedici. Sedici agenti paralleli che chiamavano strumenti hanno completato le loro attività in un tempo 2,5 volte inferiore.
Perché conta
Gli sviluppatori possono eseguire più attività di IA vincolate su un’unica GPU per laptop, risparmiando tempo e memoria.