Исследователи представили OpenProblemBench — тестовый набор из 82 нерешённых задач по математике и теоретической физике. Для каждой задачи указаны контекст исследования и чёткие критерии оценки решения. Четыре модели-оценщика проверяют правильность ответов и достигнутый прогресс, не опираясь на эталонные решения. В ходе тестирования средний процент решённых задач у GPT-6-Astra составил 14,0%; у других полноразмерных моделей с открытым кодом — от 5,5% до 6,7%, а у моделей Flash — от 2,4% до 3,7%.
Почему это важно
Результаты показывают, что новейшая большая языковая модель способна измеримо продвигаться в решении реальных научных задач и намекают на растущую роль ИИ в теоретической науке.