Uma nova avaliação da Vals AI comparou agentes de IA individuais a equipes de agentes no Vibe Code Bench. O teste usou dois modelos de ponta — GPT‑6 Sol e Claude Opus 5.5 — individualmente e em grupos de até 100 agentes. As equipes consumiram entre 1.8 × e 5.1 × mais tokens que um único modelo, mas quase não obtiveram pontuações melhores.
O que os números mostram
De quatro comparações diretas, apenas uma apresentou diferença estatisticamente significativa: o GPT‑6 Sol, com nível médio de raciocínio, marcou 7.3 pontos a mais quando operou em equipe. Na configuração máxima de raciocínio, nenhum dos modelos teve vantagem mensurável. Os dados sugerem que o custo computacional adicional de enxames de agentes raramente se traduz em maior qualidade, sobretudo quando os modelos já operam em capacidade máxima.
Por que acelerar não significa melhorar o resultado
Pesquisadores da OpenAI chegaram a uma conclusão semelhante. Em um podcast, Noam Brown observou que adicionar agentes acelera principalmente tarefas que podem ser paralelizadas, como pesquisa na web ou matemática, mas não melhora a resposta em si. Quatro agentes resolveram uma tarefa duas vezes mais rápido, mas também custaram o dobro. A expansão para dezenas de agentes mostrou retornos decrescentes e, em trabalhos criativos como escrever um romance, grandes enxames não agregam valor.
Por que importa
Para desenvolvedores que planejam o orçamento de computação em nuvem, o estudo alerta que adicionar muitos agentes de IA provavelmente aumentará os custos sem melhorar a qualidade do produto. Empresas que pretendem acelerar tarefas rotineiras devem comparar o custo em tokens com os ganhos modestos de velocidade — e talvez seja melhor otimizar os prompts de um único agente.