# AIエージェントのチーム化、コスト増のわりに成果は限定的

> Vals AIの調査によると、複数のエージェントを使うと、単一モデルの最大5倍のトークンを消費する一方、品質の向上はごくわずかだ。

Oossa · 2026-10-11 · https://oossa.com/ja/ai-agent-teams-cost-more-but-rarely-improve-results

出来事の日付: 2026-10-11

Vals AIは新たな評価で、同社のVibe Code Benchを使い、単独のAIエージェントとエージェントのチームを比較した。テスト対象は、主要モデルのGPT‑6 SolとClaude Opus 5.5。単独で動かす場合と、最大100エージェントのグループで動かす場合を調べた。チームは単独モデルの1.8 ×〜5.1 ×のトークンを消費したが、スコアはほとんど向上しなかった。

## 数値が示すこと

4つの直接比較のうち、統計的に有意な差が出たのは1つだけだった。中程度の推論設定でGPT‑6 Solをチームとして動かした場合、スコアは7.3ポイント高かった。推論設定を最大にすると、どちらのモデルも測定可能な優位性は得られなかった。データは、エージェントを大規模に動かす追加の計算コストが、品質向上につながることはまれで、モデルがすでに能力をフルに発揮している場合は特にそうだと示している。

## 速くなっても出力が良くなるとは限らない

OpenAIの研究者も同様の見解を示している。ポッドキャストでNoam Brownは、エージェントを増やすと主に、ウェブ調査や数学のように並列化しやすいタスクの処理が速くなる一方、回答そのものの質は上がらないと指摘した。4つのエージェントを使うとタスクの解決時間は半分になったが、コストも2倍になった。数十のエージェントに増やすと効果は逓減し、小説の執筆のような創作作業では、大規模なチームを組んでも価値はない。

## 事実

- Vals AIは2026年10月11日、Vibe Code BenchでGPT‑6 SolとClaude Opus 5.5をテストした。
- チーム構成では、単独のエージェントと比べて1.8 ×〜5.1 ×のトークンを消費した。
- 4つの比較のうち有意な向上が見られたのは1つだけで、中程度の推論設定でGPT‑6 Solのスコアが7.3ポイント上がった。
- 最大の推論設定では、どちらのモデルもチーム化による実質的な優位性は得られなかった。
- OpenAIのNoam Brownによると、4つのエージェントはタスクを2倍速く解決したが、コストも2倍になった。

## なぜ重要か

クラウド計算資源の予算を管理する開発者にとって、この調査は、AIエージェントを増やしても費用が膨らむだけで、製品の品質は向上しない可能性が高いことを示す。定型作業の高速化を計画する企業は、トークンコストと限られた速度向上を比較検討すべきだ。単一エージェントへの指示を最適化するほうが得策かもしれない。

## 出典と参考資料

1. [AI agent teams waste massive tokens for barely measurable quality gains, research finds](https://the-decoder.com/ai-agent-teams-waste-massive-tokens-for-barely-measurable-quality-gains-research-finds/) – The Decoder, 2026-10-11

最終更新: 2026-10-11
