Oossa

AI 에이전트 팀, 비용은 늘지만 결과 개선은 미미

Vals AI 연구에 따르면 여러 에이전트를 쓰면 단일 모델보다 토큰을 최대 5배 더 쓰지만 품질 향상은 거의 없다.

작성: Oossa 게시일: 1 분 읽기

사건 날짜:

Marvin Meyer · Unsplash

Vals AI가 새로 진행한 평가에서 Vibe Code Bench를 이용해 단일 AI 에이전트와 에이전트 팀의 성능을 비교했다. 테스트에는 선도 모델인 GPT‑6 Sol과 Claude Opus 5.5를 각각 단독으로, 그리고 최대 100개 에이전트로 구성된 팀으로 투입했다. 팀은 단일 모델보다 토큰을 1.8 ×~5.1 × 더 사용했지만 점수는 거의 나아지지 않았다.

수치가 보여주는 것

네 차례의 직접 비교 가운데 통계적으로 유의미한 결과는 단 하나였다. GPT‑6 Sol은 중간 추론 수준에서 팀으로 실행했을 때 점수가 7.3점 높았다. 추론 설정을 최대로 높였을 때는 두 모델 모두 측정 가능한 이점을 보이지 않았다. 데이터는 특히 모델이 이미 최대 성능으로 작동할 때, 에이전트 군집에 추가로 드는 컴퓨팅 비용이 품질 향상으로 이어지는 경우는 드물다는 점을 시사한다.

속도가 빨라져도 결과가 나아지는 건 아니다

OpenAI 연구진도 비슷한 결과를 전했다. 팟캐스트에서 Noam Brown은 에이전트를 추가하면 웹 조사나 수학처럼 병렬화하기 좋은 작업의 속도는 주로 빨라지지만, 답변 자체의 질이 향상되는 것은 아니라고 말했다. 에이전트 4개는 작업을 두 배 빠르게 해결했지만 비용도 두 배 들었다. 수십 개로 늘리면 효율 향상은 점차 줄었고, 소설 쓰기 같은 창작 작업에서는 에이전트 군집을 크게 구성해도 이점이 없었다.

왜 중요한가

클라우드 컴퓨팅 비용을 관리하는 개발자라면 에이전트를 많이 추가해도 제품 품질은 나아지지 않은 채 비용만 늘어날 수 있다는 점에 유의해야 한다. 일상적인 작업을 더 빠르게 처리하려는 기업은 토큰 비용과 제한적인 속도 향상을 비교해 따져봐야 하며, 단일 에이전트의 프롬프트를 최적화하는 편이 나을 수도 있다.

이 기사가 도움이 되었나요?
공유

다음 읽을거리

Oossa · 뉴스레터

이번 주 AI, 쉽게 정리

매주 월요일, 알아둘 만한 소식을 쉬운 말로. 무료, 스팸 없음.