Araştırmacılar, matematik ve teorik fizikten henüz çözülememiş 82 soruyu içeren OpenProblemBench adlı test paketini yayımladı. Her problemde araştırma bağlamı ve çözümün nasıl değerlendirileceğine ilişkin açık ölçütler yer alıyor. Dört değerlendirici model, referans yanıtlara başvurmadan gönderilen çözümleri doğruluk ve kaydedilen ilerleme açısından puanlıyor. Testlerde GPT-6-Astra’nın ortalama çözüm oranı yüzde 14,0 oldu. Diğer tam boyutlu açık modeller yüzde 5,5 ile yüzde 6,7 arasında, Flash modeller ise yüzde 2,4 ile yüzde 3,7 arasında sonuç aldı.
Neden önemli
Son büyük dil modelinin gerçek araştırma sorularında ölçülebilir ilerleme kaydedebildiğini gösteren bu sonuç, yapay zekânın teorik bilimde giderek daha fazla rol üstlenebileceğine işaret ediyor.