Oossa

AI智能体团队成本更高,效果却鲜有提升

Vals AI的研究显示,多智能体配置消耗的token最多可达单个模型的5倍,但质量提升微乎其微。

作者: Oossa 发布日期: 1 分钟阅读

事件日期:

Marvin Meyer · Unsplash

Vals AI发布的一项新评测在其 Vibe Code Bench 上比较了单个 AI 智能体与智能体团队的表现。测试对象是两款领先模型——GPT‑6 Sol 和 Claude Opus 5.5,分别以单独运行和最多由100个智能体组成的团队形式参与测试。团队消耗的 token 是单个模型的1.8 ×至5.1 ×,但得分几乎没有提高。

数据说明了什么

四组正面对比中,只有一组结果具有统计显著性:GPT‑6 Sol 在中等推理强度下以团队形式运行,得分高出7.3分。在最高推理强度下,两款模型都没有取得可测出的优势。数据表明,增加计算开销很少能转化为更高质量的结果,尤其是在模型已经全负荷运行时。

提速不等于结果更好

OpenAI 的研究人员也认同这一发现。Noam Brown 在一档播客节目中指出,增加智能体主要能加快适合并行处理的任务,例如网络研究或数学题,但不会改善答案本身。4个智能体完成一项任务的速度快了一倍,成本也增加了一倍。扩展到数十个智能体后,收益递减;对于写小说等创意工作,大规模智能体团队则毫无助益。

为什么重要

对于需要规划云计算预算的开发者来说,这项研究提醒他们:增加大量 AI 智能体很可能会推高成本,却无法提升产品质量。计划加快常规任务处理速度的公司,应权衡 token 成本与有限的提速收益;优化单智能体提示词或许更划算。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。