# Novo método acelera a geração de texto com formato definido

> Pesquisadores apresentam um mecanismo que usa pouca memória, acelera em 1,2–1,3× a geração de JSON e chamadas de ferramentas e reduz drasticamente o tamanho das gramáticas.

Oossa · 2026-10-08 · https://oossa.com/pt/new-inference-method-speeds-up-schema-constrained-language-model-output

Uma equipe liderada por Arip Asadulaev publicou um método que faz modelos de linguagem seguirem um formato de saída rigoroso sem precisar de memória extra. A técnica converte o formato em um pequeno autômato e aplica a máscara diretamente na GPU. Em um Apple M2 Pro de 16 GB, os modelos Qwen‑3.5‑2B e 4B concluíram tarefas de extração com esquema definido cerca de 1,2–1,3× mais rápido, usaram apenas 3 MB por gramática — em vez de até 1,5 GB — e permitiram que um servidor hospedasse dezesseis gramáticas. Dezesseis agentes paralelos que faziam chamadas de ferramentas concluíram suas tarefas 2,5× mais rápido.

## Os fatos

- Publicado em: 2026-10-08 ("PUBLISHED: Thu Oct 08 2026")
- Aceleração: extração 1,2–1,3× mais rápida; agentes de ferramentas 2,5× mais rápidos; gramática de 3 MB contra 1,5 GB

## Por que importa

Desenvolvedores podem executar mais tarefas de IA com saída restrita em uma única GPU de notebook, economizando tempo e memória.

## Fontes e referências

1. [Breaking the Space Barrier and its Application to Language Model Inference](https://arxiv.org/abs/2610.09139) – arXiv, 2026-10-08

Última atualização: 2026-10-08
