# OpenProblemBench发布：测试AI能否解决数学与物理未解难题

> 这套新基准收录82道尚未解决的开放问题；GPT-6-Astra解出了14%，远超其他模型。

Oossa · 2026-10-09 · https://oossa.com/zh/openproblembench-benchmark-released-for-ai-on-unsolved-math-and-physics-question

研究人员发布了OpenProblemBench，这是一套由82道数学和理论物理未解问题组成的测试集。基准为每道题提供研究背景，并明确列出评判解答的标准。四个评估模型会在没有参考答案的情况下，根据正确性和研究进展为提交的解答打分。在测试中，GPT-6-Astra的平均解题率为14.0%；其他全尺寸开放模型的成绩为5.5%至6.7%，Flash模型则为2.4%至3.7%。

## 事实

- 基准收录82道开放问题
- GPT-6-Astra的平均解题率：14.0%

## 为什么重要

这表明，最新的大型语言模型已能在真正的研究问题上取得可衡量的进展，也预示着AI在理论科学领域的作用日益增强。

## 来源与参考

1. [OpenProblemBench: Benchmarking AI on Open Problems in the Foundational Theoretical Sciences](https://arxiv.org/abs/2610.11118) – arXiv, 2026-10-09

最后更新: 2026-10-09
