Onderzoekers hebben OpenProblemBench uitgebracht, een test met 82 onopgeloste problemen uit de wiskunde en theoretische natuurkunde. Bij elk probleem geeft de benchmark de onderzoekscontext en duidelijke criteria om een oplossing te beoordelen. Vier evaluatiemodellen beoordelen inzendingen op juistheid en voortgang, zonder voorbeeldantwoorden. In tests kwam GPT-6-Astra uit op een gemiddeld oplossingspercentage van 14,0%. Andere grote open modellen scoorden tussen 5,5% en 6,7%, en Flash-modellen tussen 2,4% en 3,7%.
Waarom het ertoe doet
De resultaten laten zien dat het nieuwste grote taalmodel meetbare vooruitgang kan boeken bij echte onderzoeksvragen. Dat wijst op de groeiende rol van AI in de theoretische wetenschap.