I ricercatori hanno presentato OpenProblemBench, una raccolta di test basata su 82 problemi irrisolti di matematica e fisica teorica. Per ciascun problema, il benchmark fornisce il contesto della ricerca e criteri chiari per verificare una soluzione. Quattro modelli valutatori giudicano le risposte in base alla correttezza e ai progressi compiuti, senza disporre di soluzioni di riferimento. Nei test, GPT-6-Astra ha raggiunto un tasso medio di risoluzione del 14.0%; gli altri modelli open di dimensioni complete si sono attestati tra il 5.5% e il 6.7%, mentre i modelli Flash hanno ottenuto dal 2.4% al 3.7%.
Perché conta
Dimostra che il più recente modello linguistico di grandi dimensioni può compiere progressi misurabili su autentici quesiti di ricerca, indicando il ruolo crescente dell’IA nelle scienze teoriche.