Oossa

OpenProblemBench testet KI an ungelösten Mathe- und Physikfragen

Der neue OpenProblemBench umfasst 82 offene Probleme. GPT-6-Astra löste 14 Prozent davon und lag damit deutlich vor anderen Modellen.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Forschende haben OpenProblemBench veröffentlicht, einen Testsatz mit 82 ungelösten Problemen aus der Mathematik und der theoretischen Physik. Zu jedem Problem liefert der Benchmark den Forschungskontext und klare Kriterien zur Überprüfung einer Lösung. Vier Bewertungsmodelle beurteilen die Einsendungen nach Korrektheit und Fortschritt, ohne auf Musterlösungen zurückzugreifen. In Tests erreichte GPT-6-Astra eine durchschnittliche Lösungsquote von 14,0 Prozent. Andere Open-Source-Modelle in voller Größe kamen auf 5,5 bis 6,7 Prozent, Flash-Modelle auf 2,4 bis 3,7 Prozent.

Warum es wichtig ist

Der Benchmark zeigt, dass das neueste große Sprachmodell bei echten Forschungsfragen messbare Fortschritte erzielen kann – ein Hinweis auf die wachsende Rolle von KI in der theoretischen Wissenschaft.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.