Un gruppo di ricercatori guidato da Alex Iacob ha presentato su arXiv la Red Queen Gödel Machine (RQGM). Il sistema abbina un agente di coding a un valutatore che evolve insieme a lui e assegna un punteggio alle sue modifiche al codice. Nel benchmark DeepSWE, l’agente RQGM risolve il 82.1% dei task tenuti da parte, contro il 75.0% ottenuto da una versione di riferimento con valutatore statico. Con uno sforzo maggiore, le prestazioni di RQGM si avvicinano a quelle del modello GPT‑6 Astra. Il framework riduce inoltre di tre volte i costi di ricerca nei task di scrittura scientifica e valutazione di dimostrazioni matematiche.
Perché conta
Gli sviluppatori potrebbero avere assistenti AI per il coding capaci di migliorare continuamente senza dipendere da metriche di valutazione fisse, definite manualmente.