پژوهشگران OpenProblemBench را منتشر کردهاند؛ مجموعهآزمایشیای شامل 82 مسئلهی حلنشده در ریاضیات و فیزیک نظری. این بنچمارک برای هر مسئله پیشینهی پژوهشی و معیارهای روشنی برای ارزیابی راهحل ارائه میکند. چهار مدل ارزیاب، بدون دسترسی به پاسخهای مرجع، پاسخها را از نظر درستی و میزان پیشرفت میسنجند. در آزمونها، میانگین نرخ حل GPT-6-Astra به 14.0% رسید؛ درحالیکه مدلهای متنباز دیگر در اندازهی کامل امتیازی بین 5.5% تا 6.7% و مدلهای Flash امتیازی بین 2.4% تا 3.7% کسب کردند.
چرا مهم است
این بنچمارک نشان میدهد تازهترین مدل زبانی بزرگ میتواند در مسائل واقعی پژوهشی پیشرفتی قابلاندازهگیری داشته باشد؛ موضوعی که از نقش روبهرشد هوش مصنوعی در علوم نظری حکایت دارد.