Vals AIは新たな評価で、同社のVibe Code Benchを使い、単独のAIエージェントとエージェントのチームを比較した。テスト対象は、主要モデルのGPT‑6 SolとClaude Opus 5.5。単独で動かす場合と、最大100エージェントのグループで動かす場合を調べた。チームは単独モデルの1.8 ×〜5.1 ×のトークンを消費したが、スコアはほとんど向上しなかった。
数値が示すこと
4つの直接比較のうち、統計的に有意な差が出たのは1つだけだった。中程度の推論設定でGPT‑6 Solをチームとして動かした場合、スコアは7.3ポイント高かった。推論設定を最大にすると、どちらのモデルも測定可能な優位性は得られなかった。データは、エージェントを大規模に動かす追加の計算コストが、品質向上につながることはまれで、モデルがすでに能力をフルに発揮している場合は特にそうだと示している。
速くなっても出力が良くなるとは限らない
OpenAIの研究者も同様の見解を示している。ポッドキャストでNoam Brownは、エージェントを増やすと主に、ウェブ調査や数学のように並列化しやすいタスクの処理が速くなる一方、回答そのものの質は上がらないと指摘した。4つのエージェントを使うとタスクの解決時間は半分になったが、コストも2倍になった。数十のエージェントに増やすと効果は逓減し、小説の執筆のような創作作業では、大規模なチームを組んでも価値はない。
なぜ重要か
クラウド計算資源の予算を管理する開発者にとって、この調査は、AIエージェントを増やしても費用が膨らむだけで、製品の品質は向上しない可能性が高いことを示す。定型作業の高速化を計画する企業は、トークンコストと限られた速度向上を比較検討すべきだ。単一エージェントへの指示を最適化するほうが得策かもしれない。