Oossa

إطلاق OpenProblemBench لقياس أداء الذكاء الاصطناعي في مسائل رياضية وفيزيائية مفتوحة

تضم مجموعة OpenProblemBench الجديدة 82 مسألة مفتوحة. وحلّ GPT-6-Astra نسبة 14% منها، متفوقًا بفارق كبير على النماذج الأخرى.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أصدر باحثون OpenProblemBench، وهي مجموعة اختبارات تضم 82 مسألة لم تُحل بعد في الرياضيات والفيزياء النظرية. ويعرض المعيار السياق البحثي لكل مسألة، إلى جانب معايير واضحة للتحقق من الحل. وتتولى أربعة نماذج تقييم تصحيح الإجابات من حيث صحتها ومدى إحرازها تقدمًا، من دون الاستناد إلى إجابات مرجعية. وفي الاختبارات، حقق GPT-6-Astra متوسطًا بلغ 14.0% في حل المسائل، فيما تراوحت نتائج النماذج المفتوحة الأخرى كاملة الحجم بين 5.5% و6.7%، ونماذج Flash بين 2.4% و3.7%.

لماذا يهم

يُظهر المعيار أن أحدث نماذج اللغة الكبيرة يمكنه إحراز تقدم قابل للقياس في مسائل بحثية حقيقية، ما يلمّح إلى تنامي دور الذكاء الاصطناعي في العلوم النظرية.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.