研究人员发布了OpenProblemBench,这是一套由82道数学和理论物理未解问题组成的测试集。基准为每道题提供研究背景,并明确列出评判解答的标准。四个评估模型会在没有参考答案的情况下,根据正确性和研究进展为提交的解答打分。在测试中,GPT-6-Astra的平均解题率为14.0%;其他全尺寸开放模型的成绩为5.5%至6.7%,Flash模型则为2.4%至3.7%。
为什么重要
这表明,最新的大型语言模型已能在真正的研究问题上取得可衡量的进展,也预示着AI在理论科学领域的作用日益增强。
这套新基准收录82道尚未解决的开放问题;GPT-6-Astra解出了14%,远超其他模型。
简讯作者: OossaOossa 发布日期: 1 分钟阅读
研究人员发布了OpenProblemBench,这是一套由82道数学和理论物理未解问题组成的测试集。基准为每道题提供研究背景,并明确列出评判解答的标准。四个评估模型会在没有参考答案的情况下,根据正确性和研究进展为提交的解答打分。在测试中,GPT-6-Astra的平均解题率为14.0%;其他全尺寸开放模型的成绩为5.5%至6.7%,Flash模型则为2.4%至3.7%。
这表明,最新的大型语言模型已能在真正的研究问题上取得可衡量的进展,也预示着AI在理论科学领域的作用日益增强。
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。