UniPat AI发布了PaperBenchX,用93篇真实论文设计复现任务,测试AI能否在科学软件中重做研究并提供可验证的证据。任务覆盖12个研究方向;评测会删除代理生成的输出、断开网络,再从头运行提交的工作流。
据该团队公布的结果,GPT-6 Astra在这93项任务中的完整复现率为13.98%。PaperBenchX还报告,受测配置的验证阶段平均得分为42.80%,低于建模和执行阶段的62.70%与61.84%。团队已开源12项测试任务,另有81项封闭任务。
为什么重要
对使用AI代理做科研的研究者来说,这项测试显示,模型能运行部分计算,不等于能可靠重现论文结论;它是否能提升实际研究效率,仍需更多验证。