Vals AI के एक नए मूल्यांकन में उसके Vibe Code Bench पर अकेले AI एजेंटों और एजेंटों की टीमों की तुलना की गई। परीक्षण में दो प्रमुख मॉडल—GPT‑6 Sol और Claude Opus 5.5—को अकेले और 100 एजेंटों तक के समूहों में चलाया गया। टीमों ने अकेले मॉडल के मुकाबले 1.8 × से 5.1 × ज्यादा टोकन खर्च किए, लेकिन उनके स्कोर में लगभग कोई सुधार नहीं हुआ।
आंकड़े क्या बताते हैं
आमने-सामने की चार तुलनाओं में केवल एक का नतीजा सांख्यिकीय रूप से महत्वपूर्ण था: मध्यम रीजनिंग स्तर पर टीम के रूप में चलाए जाने पर GPT‑6 Sol का स्कोर 7.3 अंक ज्यादा रहा। रीजनिंग की अधिकतम सेटिंग पर किसी भी मॉडल को मापने योग्य बढ़त नहीं मिली। आंकड़े बताते हैं कि एजेंटों के समूह पर अतिरिक्त कंप्यूट खर्च से शायद ही गुणवत्ता बढ़ती है—खासकर तब, जब मॉडल पहले से ही पूरी क्षमता पर चल रहे हों।
तेजी से काम पूरा होना बेहतर नतीजे की गारंटी नहीं
OpenAI के शोधकर्ता भी इसी निष्कर्ष से सहमत हैं। एक पॉडकास्ट में Noam Brown ने कहा कि एजेंट जोड़ने से मुख्य रूप से उन कामों में तेजी आती है जिन्हें समानांतर रूप से किया जा सकता है, जैसे वेब पर रिसर्च या गणित के सवाल हल करना; इससे जवाब खुद बेहतर नहीं होता। चार एजेंटों ने एक काम आधे समय में पूरा किया, लेकिन इसकी लागत भी दोगुनी आई। दर्जनों एजेंटों तक विस्तार करने पर फायदे घटते गए, और उपन्यास लेखन जैसे रचनात्मक कामों में बड़े समूहों से कोई लाभ नहीं मिला।
यह क्यों मायने रखता है
क्लाउड कंप्यूट का बजट बनाने वाले डेवलपरों के लिए यह अध्ययन चेतावनी देता है कि ज्यादा AI एजेंट जोड़ने से खर्च बढ़ने की आशंका है, जबकि उत्पाद की गुणवत्ता में सुधार नहीं होगा। रोजमर्रा के काम तेजी से कराने की योजना बना रही कंपनियों को टोकन की लागत और समय की सीमित बचत के बीच संतुलन देखना चाहिए। उनके लिए अकेले एजेंट के प्रॉम्प्ट बेहतर करना ज्यादा कारगर हो सकता है।