Oossa

OpenProblemBench发布:测试AI能否解决数学与物理未解难题

这套新基准收录82道尚未解决的开放问题;GPT-6-Astra解出了14%,远超其他模型。

简讯作者: Oossa 发布日期: 1 分钟阅读

研究人员发布了OpenProblemBench,这是一套由82道数学和理论物理未解问题组成的测试集。基准为每道题提供研究背景,并明确列出评判解答的标准。四个评估模型会在没有参考答案的情况下,根据正确性和研究进展为提交的解答打分。在测试中,GPT-6-Astra的平均解题率为14.0%;其他全尺寸开放模型的成绩为5.5%至6.7%,Flash模型则为2.4%至3.7%。

为什么重要

这表明,最新的大型语言模型已能在真正的研究问题上取得可衡量的进展,也预示着AI在理论科学领域的作用日益增强。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。