数学と理論物理学の未解決問題82件を集めた評価セット「OpenProblemBench」が研究者らによって公開された。各問題には研究の背景と、解答を判定する明確な基準が添えられている。提出された解答は、正解例を参照せずに4つの評価モデルが採点し、正確さと進展度を評価する。テストでは、GPT-6-Astraの平均解決率は14.0%だった一方、他のフルサイズのオープンモデルは5.5~6.7%、Flashモデルは2.4~3.7%だった。
なぜ重要か
最新の大規模言語モデルが、実際の研究課題で測定可能な進展を挙げられることを示しており、理論科学におけるAIの役割が広がりつつあることをうかがわせる。