Forschende haben OpenProblemBench veröffentlicht, einen Testsatz mit 82 ungelösten Problemen aus der Mathematik und der theoretischen Physik. Zu jedem Problem liefert der Benchmark den Forschungskontext und klare Kriterien zur Überprüfung einer Lösung. Vier Bewertungsmodelle beurteilen die Einsendungen nach Korrektheit und Fortschritt, ohne auf Musterlösungen zurückzugreifen. In Tests erreichte GPT-6-Astra eine durchschnittliche Lösungsquote von 14,0 Prozent. Andere Open-Source-Modelle in voller Größe kamen auf 5,5 bis 6,7 Prozent, Flash-Modelle auf 2,4 bis 3,7 Prozent.
Warum es wichtig ist
Der Benchmark zeigt, dass das neueste große Sprachmodell bei echten Forschungsfragen messbare Fortschritte erzielen kann – ein Hinweis auf die wachsende Rolle von KI in der theoretischen Wissenschaft.