# انتشار بنچمارک OpenProblemBench برای مسائل حل‌نشده ریاضی و فیزیک

> مجموعه‌ی تازه‌ی OpenProblemBench شامل 82 مسئله‌ی باز است؛ GPT-6-Astra توانست 14% آن‌ها را حل کند، بسیار بیشتر از مدل‌های دیگر.

Oossa · 2026-10-09 · https://oossa.com/fa/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

پژوهشگران OpenProblemBench را منتشر کرده‌اند؛ مجموعه‌آزمایشی‌ای شامل 82 مسئله‌ی حل‌نشده در ریاضیات و فیزیک نظری. این بنچمارک برای هر مسئله پیشینه‌ی پژوهشی و معیارهای روشنی برای ارزیابی راه‌حل ارائه می‌کند. چهار مدل ارزیاب، بدون دسترسی به پاسخ‌های مرجع، پاسخ‌ها را از نظر درستی و میزان پیشرفت می‌سنجند. در آزمون‌ها، میانگین نرخ حل GPT-6-Astra به 14.0% رسید؛ درحالی‌که مدل‌های متن‌باز دیگر در اندازه‌ی کامل امتیازی بین 5.5% تا 6.7% و مدل‌های Flash امتیازی بین 2.4% تا 3.7% کسب کردند.

## حقایق

- 82 مسئله‌ی باز در این بنچمارک
- میانگین نرخ حل GPT-6-Astra: 14.0%

## چرا مهم است

این بنچمارک نشان می‌دهد تازه‌ترین مدل زبانی بزرگ می‌تواند در مسائل واقعی پژوهشی پیشرفتی قابل‌اندازه‌گیری داشته باشد؛ موضوعی که از نقش رو‌به‌رشد هوش مصنوعی در علوم نظری حکایت دارد.

## منابع و ارجاع‌ها

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
