# 未解決の数学・物理問題を評価する「OpenProblemBench」公開

> 未解決問題82件を収録した新ベンチマークで、GPT-6-Astraは14％を解決。他のモデルを大きく上回った。

Oossa · 2026-10-09 · https://oossa.com/ja/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

数学と理論物理学の未解決問題82件を集めた評価セット「OpenProblemBench」が研究者らによって公開された。各問題には研究の背景と、解答を判定する明確な基準が添えられている。提出された解答は、正解例を参照せずに4つの評価モデルが採点し、正確さと進展度を評価する。テストでは、GPT-6-Astraの平均解決率は14.0％だった一方、他のフルサイズのオープンモデルは5.5～6.7％、Flashモデルは2.4～3.7％だった。

## 事実

- ベンチマークには未解決問題を82件収録
- GPT-6-Astraの平均解決率：14.0％

## なぜ重要か

最新の大規模言語モデルが、実際の研究課題で測定可能な進展を挙げられることを示しており、理論科学におけるAIの役割が広がりつつあることをうかがわせる。

## 出典と参考資料

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

最終更新: 2026-10-09
