Oossa

OpenProblemBench testar AI på olösta frågor i matematik och fysik

Den nya testsviten OpenProblemBench innehåller 82 olösta problem. GPT-6-Astra löste 14 % av dem, långt fler än andra modeller.

NotisAv Publicerad av Oossa: 1 min läsning

Forskare har lanserat OpenProblemBench, en testsvit med 82 olösta problem inom matematik och teoretisk fysik. För varje problem ger testsviten forskningsbakgrund och tydliga kriterier för att bedöma en lösning. Fyra utvärderingsmodeller bedömer inlämnade lösningar utifrån korrekthet och framsteg, utan att jämföra med facit. I testerna hade GPT-6-Astra en genomsnittlig lösningsgrad på 14.0 %, medan andra fullstora öppna modeller fick mellan 5.5 % och 6.7 %, och Flash-modeller 2.4 % till 3.7 %.

Varför det spelar roll

Det visar att den senaste stora språkmodellen kan göra mätbara framsteg med verkliga forskningsfrågor och antyder att AI får en allt större roll inom teoretisk vetenskap.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.