Oossa

OpenProblemBench évalue l’IA sur des questions de maths et de physique non résolues

Ce nouveau jeu de données rassemble 82 problèmes ouverts. GPT-6-Astra en a résolu 14 %, loin devant les autres modèles.

BrèvePar Publié par Oossa: 1 min de lecture

Des chercheurs ont publié OpenProblemBench, un ensemble de tests réunissant 82 problèmes non résolus de mathématiques et de physique théorique. Pour chaque problème, le benchmark fournit le contexte de recherche et des critères précis permettant d’évaluer une solution. Quatre modèles évaluateurs notent les réponses selon leur exactitude et les progrès réalisés, sans disposer de réponses de référence. Lors des tests, GPT-6-Astra a obtenu un taux moyen de résolution de 14.0 %, contre 5.5 % à 6.7 % pour les autres modèles ouverts de grande taille et 2.4 % à 3.7 % pour les modèles Flash.

Pourquoi c'est important

Ces résultats montrent que le dernier grand modèle de langage peut apporter des avancées mesurables sur de véritables questions de recherche, ce qui laisse entrevoir le rôle croissant de l’IA dans les sciences théoriques.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.