Vals AI发布的一项新评测在其 Vibe Code Bench 上比较了单个 AI 智能体与智能体团队的表现。测试对象是两款领先模型——GPT‑6 Sol 和 Claude Opus 5.5,分别以单独运行和最多由100个智能体组成的团队形式参与测试。团队消耗的 token 是单个模型的1.8 ×至5.1 ×,但得分几乎没有提高。
数据说明了什么
四组正面对比中,只有一组结果具有统计显著性:GPT‑6 Sol 在中等推理强度下以团队形式运行,得分高出7.3分。在最高推理强度下,两款模型都没有取得可测出的优势。数据表明,增加计算开销很少能转化为更高质量的结果,尤其是在模型已经全负荷运行时。
提速不等于结果更好
OpenAI 的研究人员也认同这一发现。Noam Brown 在一档播客节目中指出,增加智能体主要能加快适合并行处理的任务,例如网络研究或数学题,但不会改善答案本身。4个智能体完成一项任务的速度快了一倍,成本也增加了一倍。扩展到数十个智能体后,收益递减;对于写小说等创意工作,大规模智能体团队则毫无助益。
为什么重要
对于需要规划云计算预算的开发者来说,这项研究提醒他们:增加大量 AI 智能体很可能会推高成本,却无法提升产品质量。计划加快常规任务处理速度的公司,应权衡 token 成本与有限的提速收益;优化单智能体提示词或许更划算。