Vals AI가 새로 진행한 평가에서 Vibe Code Bench를 이용해 단일 AI 에이전트와 에이전트 팀의 성능을 비교했다. 테스트에는 선도 모델인 GPT‑6 Sol과 Claude Opus 5.5를 각각 단독으로, 그리고 최대 100개 에이전트로 구성된 팀으로 투입했다. 팀은 단일 모델보다 토큰을 1.8 ×~5.1 × 더 사용했지만 점수는 거의 나아지지 않았다.
수치가 보여주는 것
네 차례의 직접 비교 가운데 통계적으로 유의미한 결과는 단 하나였다. GPT‑6 Sol은 중간 추론 수준에서 팀으로 실행했을 때 점수가 7.3점 높았다. 추론 설정을 최대로 높였을 때는 두 모델 모두 측정 가능한 이점을 보이지 않았다. 데이터는 특히 모델이 이미 최대 성능으로 작동할 때, 에이전트 군집에 추가로 드는 컴퓨팅 비용이 품질 향상으로 이어지는 경우는 드물다는 점을 시사한다.
속도가 빨라져도 결과가 나아지는 건 아니다
OpenAI 연구진도 비슷한 결과를 전했다. 팟캐스트에서 Noam Brown은 에이전트를 추가하면 웹 조사나 수학처럼 병렬화하기 좋은 작업의 속도는 주로 빨라지지만, 답변 자체의 질이 향상되는 것은 아니라고 말했다. 에이전트 4개는 작업을 두 배 빠르게 해결했지만 비용도 두 배 들었다. 수십 개로 늘리면 효율 향상은 점차 줄었고, 소설 쓰기 같은 창작 작업에서는 에이전트 군집을 크게 구성해도 이점이 없었다.
왜 중요한가
클라우드 컴퓨팅 비용을 관리하는 개발자라면 에이전트를 많이 추가해도 제품 품질은 나아지지 않은 채 비용만 늘어날 수 있다는 점에 유의해야 한다. 일상적인 작업을 더 빠르게 처리하려는 기업은 토큰 비용과 제한적인 속도 향상을 비교해 따져봐야 하며, 단일 에이전트의 프롬프트를 최적화하는 편이 나을 수도 있다.