# AI智能体团队成本更高，效果却鲜有提升

> Vals AI的研究显示，多智能体配置消耗的token最多可达单个模型的5倍，但质量提升微乎其微。

Oossa · 2026-10-11 · https://oossa.com/zh/ai-agent-teams-cost-more-but-rarely-improve-results

事件日期: 2026-10-11

Vals AI发布的一项新评测在其 Vibe Code Bench 上比较了单个 AI 智能体与智能体团队的表现。测试对象是两款领先模型——GPT‑6 Sol 和 Claude Opus 5.5，分别以单独运行和最多由100个智能体组成的团队形式参与测试。团队消耗的 token 是单个模型的1.8 ×至5.1 ×，但得分几乎没有提高。

## 数据说明了什么

四组正面对比中，只有一组结果具有统计显著性：GPT‑6 Sol 在中等推理强度下以团队形式运行，得分高出7.3分。在最高推理强度下，两款模型都没有取得可测出的优势。数据表明，增加计算开销很少能转化为更高质量的结果，尤其是在模型已经全负荷运行时。

## 提速不等于结果更好

OpenAI 的研究人员也认同这一发现。Noam Brown 在一档播客节目中指出，增加智能体主要能加快适合并行处理的任务，例如网络研究或数学题，但不会改善答案本身。4个智能体完成一项任务的速度快了一倍，成本也增加了一倍。扩展到数十个智能体后，收益递减；对于写小说等创意工作，大规模智能体团队则毫无助益。

## 事实

- Vals AI 于2026年10月11日在 Vibe Code Bench 上测试了 GPT‑6 Sol 和 Claude Opus 5.5。
- 团队配置消耗的 token 是单个智能体的1.8 ×至5.1 ×。
- 四组对比中，只有一组显示出显著提升：GPT‑6 Sol 在中等推理强度下得分提高7.3分。
- 在最高推理强度下，两款模型都没有从团队配置中获得实际优势。
- OpenAI 的 Noam Brown 表示，4个智能体完成任务的速度快了一倍，但成本也翻了一倍。

## 为什么重要

对于需要规划云计算预算的开发者来说，这项研究提醒他们：增加大量 AI 智能体很可能会推高成本，却无法提升产品质量。计划加快常规任务处理速度的公司，应权衡 token 成本与有限的提速收益；优化单智能体提示词或许更划算。

## 来源与参考

1. [AI agent teams waste massive tokens for barely measurable quality gains, research finds](https://the-decoder.com/ai-agent-teams-waste-massive-tokens-for-barely-measurable-quality-gains-research-finds/) – The Decoder, 2026-10-11

最后更新: 2026-10-11
