# OpenProblemBench test AI op onopgeloste wiskunde- en natuurkundeproblemen

> De nieuwe benchmark bevat 82 open problemen. GPT-6-Astra loste er 14% op, veel meer dan andere modellen.

Oossa · 2026-10-09 · https://oossa.com/nl/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

Onderzoekers hebben OpenProblemBench uitgebracht, een test met 82 onopgeloste problemen uit de wiskunde en theoretische natuurkunde. Bij elk probleem geeft de benchmark de onderzoekscontext en duidelijke criteria om een oplossing te beoordelen. Vier evaluatiemodellen beoordelen inzendingen op juistheid en voortgang, zonder voorbeeldantwoorden. In tests kwam GPT-6-Astra uit op een gemiddeld oplossingspercentage van 14,0%. Andere grote open modellen scoorden tussen 5,5% en 6,7%, en Flash-modellen tussen 2,4% en 3,7%.

## De feiten

- 82 open problemen in de benchmark
- Gemiddeld oplossingspercentage van GPT-6-Astra: 14,0%

## Waarom het ertoe doet

De resultaten laten zien dat het nieuwste grote taalmodel meetbare vooruitgang kan boeken bij echte onderzoeksvragen. Dat wijst op de groeiende rol van AI in de theoretische wetenschap.

## Bronnen en referenties

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Laatst bijgewerkt: 2026-10-09
