由Alex Iacob领衔的研究人员在arXiv上发布了Red Queen Gödel Machine(RQGM)。该系统将编程代理与协同进化的评审器配对,由后者为代理提交的代码补丁评分。在DeepSWE基准测试中,RQGM编程代理解决了82.1%的留出任务,而采用固定评估器的基线系统解决了75.0%。在更高的计算投入下,RQGM的表现接近GPT‑6 Astra模型。该框架还将科学写作和证明评分任务的搜索成本降低至原来的三分之一。
为什么重要
开发者或许能获得不断自我改进的AI编程助手,而不必依赖固定的、由人工编写的评估指标。