ارزیابی تازه Vals AI عملکرد عاملهای هوش مصنوعی منفرد را با تیمهای چندعاملی در آزمون Vibe Code Bench مقایسه کرده است. در این آزمون، دو مدل پیشرو، GPT‑6 Sol و Claude Opus 5.5، بهصورت تکی و در گروههایی تا سقف ۱۰۰ عامل آزمایش شدند. تیمها بین ۱٫۸ تا ۵٫۱ برابر بیشتر از یک مدلِ تنها توکن مصرف کردند، اما امتیازهایشان تقریباً بهتر نشد.
اعداد چه میگویند؟
از چهار مقایسه رودررو، فقط یکی از نظر آماری معنادار بود: GPT‑6 Sol در سطح استدلال متوسط، وقتی بهصورت تیمی اجرا شد، ۷٫۳ امتیاز بیشتر گرفت. در بالاترین سطح استدلال، هیچیک از دو مدل برتری قابلاندازهگیری نداشت. دادهها نشان میدهد هزینه محاسباتی اضافیِ گروههای بزرگ عاملها بهندرت به کیفیت بالاتر میانجامد؛ بهویژه وقتی مدلها از قبل با حداکثر ظرفیت کار میکنند.
چرا سرعت بیشتر به خروجی بهتر نمیانجامد؟
پژوهشگران OpenAI هم به نتیجه مشابهی رسیدهاند. Noam Brown در یک پادکست گفت اضافهکردن عاملها عمدتاً کارهایی را سریعتر میکند که بهخوبی قابلموازیسازیاند، مثل پژوهش در وب یا ریاضی، اما خود پاسخ را بهتر نمیکند. چهار عامل یک کار را دو برابر سریعتر انجام دادند، اما هزینه هم دو برابر شد. استفاده از دهها عامل بازده کاهنده داشت و گروههای بزرگ برای کارهای خلاقانهای مثل نوشتن رمان، ارزشی اضافه نمیکنند.
چرا مهم است
برای توسعهدهندگانی که هزینه رایانش ابری را مدیریت میکنند، این پژوهش هشداری است که افزودن تعداد زیادی عامل هوش مصنوعی احتمالاً هزینهها را بالا میبرد، بیآنکه کیفیت محصول را بهتر کند. شرکتهایی که قصد دارند کارهای روزمره را سریعتر انجام دهند، باید هزینه توکنها را در برابر افزایش محدود سرعت بسنجند؛ شاید بهینهسازی دستورهای عامل منفرد گزینه بهتری باشد.