# Вышел бенчмарк OpenProblemBench для нерешённых задач по математике и физике

> В набор OpenProblemBench вошли 82 нерешённые задачи. GPT-6-Astra решил 14% из них — намного больше, чем другие модели.

Oossa · 2026-10-09 · https://oossa.com/ru/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

Исследователи представили OpenProblemBench — тестовый набор из 82 нерешённых задач по математике и теоретической физике. Для каждой задачи указаны контекст исследования и чёткие критерии оценки решения. Четыре модели-оценщика проверяют правильность ответов и достигнутый прогресс, не опираясь на эталонные решения. В ходе тестирования средний процент решённых задач у GPT-6-Astra составил 14,0%; у других полноразмерных моделей с открытым кодом — от 5,5% до 6,7%, а у моделей Flash — от 2,4% до 3,7%.

## Факты

- В бенчмарк вошли 82 нерешённые задачи
- Средний процент решённых задач у GPT-6-Astra: 14,0%

## Почему это важно

Результаты показывают, что новейшая большая языковая модель способна измеримо продвигаться в решении реальных научных задач и намекают на растущую роль ИИ в теоретической науке.

## Источники и ссылки

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

Обновлено: 2026-10-09
