Oossa

OpenProblemBench test AI op onopgeloste wiskunde- en natuurkundeproblemen

De nieuwe benchmark bevat 82 open problemen. GPT-6-Astra loste er 14% op, veel meer dan andere modellen.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Onderzoekers hebben OpenProblemBench uitgebracht, een test met 82 onopgeloste problemen uit de wiskunde en theoretische natuurkunde. Bij elk probleem geeft de benchmark de onderzoekscontext en duidelijke criteria om een oplossing te beoordelen. Vier evaluatiemodellen beoordelen inzendingen op juistheid en voortgang, zonder voorbeeldantwoorden. In tests kwam GPT-6-Astra uit op een gemiddeld oplossingspercentage van 14,0%. Andere grote open modellen scoorden tussen 5,5% en 6,7%, en Flash-modellen tussen 2,4% en 3,7%.

Waarom het ertoe doet

De resultaten laten zien dat het nieuwste grote taalmodel meetbare vooruitgang kan boeken bij echte onderzoeksvragen. Dat wijst op de groeiende rol van AI in de theoretische wetenschap.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.