Oossa

Вышел бенчмарк OpenProblemBench для нерешённых задач по математике и физике

В набор OpenProblemBench вошли 82 нерешённые задачи. GPT-6-Astra решил 14% из них — намного больше, чем другие модели.

ЗаметкаАвтор: Опубликовано Oossa: 1 мин чтения

Исследователи представили OpenProblemBench — тестовый набор из 82 нерешённых задач по математике и теоретической физике. Для каждой задачи указаны контекст исследования и чёткие критерии оценки решения. Четыре модели-оценщика проверяют правильность ответов и достигнутый прогресс, не опираясь на эталонные решения. В ходе тестирования средний процент решённых задач у GPT-6-Astra составил 14,0%; у других полноразмерных моделей с открытым кодом — от 5,5% до 6,7%, а у моделей Flash — от 2,4% до 3,7%.

Почему это важно

Результаты показывают, что новейшая большая языковая модель способна измеримо продвигаться в решении реальных научных задач и намекают на растущую роль ИИ в теоретической науке.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.