Oossa

انتشار بنچمارک OpenProblemBench برای مسائل حل‌نشده ریاضی و فیزیک

مجموعه‌ی تازه‌ی OpenProblemBench شامل 82 مسئله‌ی باز است؛ GPT-6-Astra توانست 14% آن‌ها را حل کند، بسیار بیشتر از مدل‌های دیگر.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

پژوهشگران OpenProblemBench را منتشر کرده‌اند؛ مجموعه‌آزمایشی‌ای شامل 82 مسئله‌ی حل‌نشده در ریاضیات و فیزیک نظری. این بنچمارک برای هر مسئله پیشینه‌ی پژوهشی و معیارهای روشنی برای ارزیابی راه‌حل ارائه می‌کند. چهار مدل ارزیاب، بدون دسترسی به پاسخ‌های مرجع، پاسخ‌ها را از نظر درستی و میزان پیشرفت می‌سنجند. در آزمون‌ها، میانگین نرخ حل GPT-6-Astra به 14.0% رسید؛ درحالی‌که مدل‌های متن‌باز دیگر در اندازه‌ی کامل امتیازی بین 5.5% تا 6.7% و مدل‌های Flash امتیازی بین 2.4% تا 3.7% کسب کردند.

چرا مهم است

این بنچمارک نشان می‌دهد تازه‌ترین مدل زبانی بزرگ می‌تواند در مسائل واقعی پژوهشی پیشرفتی قابل‌اندازه‌گیری داشته باشد؛ موضوعی که از نقش رو‌به‌رشد هوش مصنوعی در علوم نظری حکایت دارد.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.