शोधकर्ताओं ने OpenProblemBench जारी किया है, जिसमें गणित और सैद्धांतिक भौतिकी के 82 अनसुलझे सवाल शामिल हैं। इस बेंचमार्क में हर सवाल के साथ उसका शोध-संदर्भ और समाधान जांचने के स्पष्ट मानदंड दिए गए हैं। चार मूल्यांकन मॉडल बिना किसी संदर्भ-उत्तर के, दिए गए समाधानों की शुद्धता और प्रगति को परखते हैं। परीक्षणों में GPT-6-Astra ने औसतन 14.0% सवाल हल किए, जबकि दूसरे पूर्ण आकार के ओपन मॉडल का स्कोर 5.5% से 6.7% के बीच और Flash मॉडल का 2.4% से 3.7% के बीच रहा।
यह क्यों मायने रखता है
यह दिखाता है कि नवीनतम बड़े भाषा मॉडल वास्तविक शोध-सवालों पर मापने योग्य प्रगति कर सकता है। इससे सैद्धांतिक विज्ञान में AI की बढ़ती भूमिका के संकेत मिलते हैं।