Uma equipe liderada por Arip Asadulaev publicou um método que faz modelos de linguagem seguirem um formato de saída rigoroso sem precisar de memória extra. A técnica converte o formato em um pequeno autômato e aplica a máscara diretamente na GPU. Em um Apple M2 Pro de 16 GB, os modelos Qwen‑3.5‑2B e 4B concluíram tarefas de extração com esquema definido cerca de 1,2–1,3× mais rápido, usaram apenas 3 MB por gramática — em vez de até 1,5 GB — e permitiram que um servidor hospedasse dezesseis gramáticas. Dezesseis agentes paralelos que faziam chamadas de ferramentas concluíram suas tarefas 2,5× mais rápido.
Por que importa
Desenvolvedores podem executar mais tarefas de IA com saída restrita em uma única GPU de notebook, economizando tempo e memória.