Pesquisadores liderados por Alex Iacob publicaram o Red Queen Gödel Machine (RQGM) no arXiv. O sistema combina um agente de programação com um avaliador que evolui junto com ele e dá notas às suas correções. No benchmark DeepSWE, o agente do RQGM resolve 82.1% das tarefas reservadas para teste, enquanto um modelo de referência com avaliador estático resolve 75.0%. Com mais esforço, o desempenho do RQGM se aproxima do modelo GPT‑6 Astra. A estrutura também reduz em três vezes o custo de busca em tarefas de redação científica e avaliação de provas.
Por que importa
Desenvolvedores poderão contar com assistentes de programação de IA que continuam melhorando sem depender de uma métrica de avaliação fixa, escrita por humanos.