Des chercheurs ont publié OpenProblemBench, un ensemble de tests réunissant 82 problèmes non résolus de mathématiques et de physique théorique. Pour chaque problème, le benchmark fournit le contexte de recherche et des critères précis permettant d’évaluer une solution. Quatre modèles évaluateurs notent les réponses selon leur exactitude et les progrès réalisés, sans disposer de réponses de référence. Lors des tests, GPT-6-Astra a obtenu un taux moyen de résolution de 14.0 %, contre 5.5 % à 6.7 % pour les autres modèles ouverts de grande taille et 2.4 % à 3.7 % pour les modèles Flash.
Pourquoi c'est important
Ces résultats montrent que le dernier grand modèle de langage peut apporter des avancées mesurables sur de véritables questions de recherche, ce qui laisse entrevoir le rôle croissant de l’IA dans les sciences théoriques.