Forskare har lanserat OpenProblemBench, en testsvit med 82 olösta problem inom matematik och teoretisk fysik. För varje problem ger testsviten forskningsbakgrund och tydliga kriterier för att bedöma en lösning. Fyra utvärderingsmodeller bedömer inlämnade lösningar utifrån korrekthet och framsteg, utan att jämföra med facit. I testerna hade GPT-6-Astra en genomsnittlig lösningsgrad på 14.0 %, medan andra fullstora öppna modeller fick mellan 5.5 % och 6.7 %, och Flash-modeller 2.4 % till 3.7 %.
Varför det spelar roll
Det visar att den senaste stora språkmodellen kan göra mätbara framsteg med verkliga forskningsfrågor och antyder att AI får en allt större roll inom teoretisk vetenskap.