Oossa

Novo método acelera a geração de texto com formato definido

Pesquisadores apresentam um mecanismo que usa pouca memória, acelera em 1,2–1,3× a geração de JSON e chamadas de ferramentas e reduz drasticamente o tamanho das gramáticas.

NotaPor Publicado pelo Oossa: 1 min de leitura

Uma equipe liderada por Arip Asadulaev publicou um método que faz modelos de linguagem seguirem um formato de saída rigoroso sem precisar de memória extra. A técnica converte o formato em um pequeno autômato e aplica a máscara diretamente na GPU. Em um Apple M2 Pro de 16 GB, os modelos Qwen‑3.5‑2B e 4B concluíram tarefas de extração com esquema definido cerca de 1,2–1,3× mais rápido, usaram apenas 3 MB por gramática — em vez de até 1,5 GB — e permitiram que um servidor hospedasse dezesseis gramáticas. Dezesseis agentes paralelos que faziam chamadas de ferramentas concluíram suas tarefas 2,5× mais rápido.

Por que importa

Desenvolvedores podem executar mais tarefas de IA com saída restrita em uma única GPU de notebook, economizando tempo e memória.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.