Oossa

تیم‌های عامل هوش مصنوعی پرهزینه‌اند و به‌ندرت نتیجه را بهتر می‌کنند

پژوهش Vals AI نشان می‌دهد سامانه‌های چندعاملی ممکن است تا پنج برابر یک مدلِ تنها توکن مصرف کنند، اما کیفیت را فقط اندکی افزایش دهند.

نویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

تاریخ رویداد:

Marvin Meyer · Unsplash

ارزیابی تازه Vals AI عملکرد عامل‌های هوش مصنوعی منفرد را با تیم‌های چندعاملی در آزمون Vibe Code Bench مقایسه کرده است. در این آزمون، دو مدل پیشرو، GPT‑6 Sol و Claude Opus 5.5، به‌صورت تکی و در گروه‌هایی تا سقف ۱۰۰ عامل آزمایش شدند. تیم‌ها بین ۱٫۸ تا ۵٫۱ برابر بیشتر از یک مدلِ تنها توکن مصرف کردند، اما امتیازهایشان تقریباً بهتر نشد.

اعداد چه می‌گویند؟

از چهار مقایسه رودررو، فقط یکی از نظر آماری معنادار بود: GPT‑6 Sol در سطح استدلال متوسط، وقتی به‌صورت تیمی اجرا شد، ۷٫۳ امتیاز بیشتر گرفت. در بالاترین سطح استدلال، هیچ‌یک از دو مدل برتری قابل‌اندازه‌گیری نداشت. داده‌ها نشان می‌دهد هزینه محاسباتی اضافیِ گروه‌های بزرگ عامل‌ها به‌ندرت به کیفیت بالاتر می‌انجامد؛ به‌ویژه وقتی مدل‌ها از قبل با حداکثر ظرفیت کار می‌کنند.

چرا سرعت بیشتر به خروجی بهتر نمی‌انجامد؟

پژوهشگران OpenAI هم به نتیجه مشابهی رسیده‌اند. Noam Brown در یک پادکست گفت اضافه‌کردن عامل‌ها عمدتاً کارهایی را سریع‌تر می‌کند که به‌خوبی قابل‌موازی‌سازی‌اند، مثل پژوهش در وب یا ریاضی، اما خود پاسخ را بهتر نمی‌کند. چهار عامل یک کار را دو برابر سریع‌تر انجام دادند، اما هزینه هم دو برابر شد. استفاده از ده‌ها عامل بازده کاهنده داشت و گروه‌های بزرگ برای کارهای خلاقانه‌ای مثل نوشتن رمان، ارزشی اضافه نمی‌کنند.

چرا مهم است

برای توسعه‌دهندگانی که هزینه رایانش ابری را مدیریت می‌کنند، این پژوهش هشداری است که افزودن تعداد زیادی عامل هوش مصنوعی احتمالاً هزینه‌ها را بالا می‌برد، بی‌آنکه کیفیت محصول را بهتر کند. شرکت‌هایی که قصد دارند کارهای روزمره را سریع‌تر انجام دهند، باید هزینه توکن‌ها را در برابر افزایش محدود سرعت بسنجند؛ شاید بهینه‌سازی دستورهای عامل منفرد گزینه بهتری باشد.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.