# OpenProblemBench testet KI an ungelösten Mathe- und Physikfragen

> Der neue OpenProblemBench umfasst 82 offene Probleme. GPT-6-Astra löste 14 Prozent davon und lag damit deutlich vor anderen Modellen.

Oossa · 2026-10-09 · https://oossa.com/de/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

Forschende haben OpenProblemBench veröffentlicht, einen Testsatz mit 82 ungelösten Problemen aus der Mathematik und der theoretischen Physik. Zu jedem Problem liefert der Benchmark den Forschungskontext und klare Kriterien zur Überprüfung einer Lösung. Vier Bewertungsmodelle beurteilen die Einsendungen nach Korrektheit und Fortschritt, ohne auf Musterlösungen zurückzugreifen. In Tests erreichte GPT-6-Astra eine durchschnittliche Lösungsquote von 14,0 Prozent. Andere Open-Source-Modelle in voller Größe kamen auf 5,5 bis 6,7 Prozent, Flash-Modelle auf 2,4 bis 3,7 Prozent.

## Die Fakten

- 82 offene Probleme im Benchmark
- Durchschnittliche Lösungsquote von GPT-6-Astra: 14,0 Prozent

## Warum es wichtig ist

Der Benchmark zeigt, dass das neueste große Sprachmodell bei echten Forschungsfragen messbare Fortschritte erzielen kann – ein Hinweis auf die wachsende Rolle von KI in der theoretischen Wissenschaft.

## Quellen und Referenzen

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Zuletzt aktualisiert: 2026-10-09
