Des chercheurs dirigés par Alex Iacob ont publié Red Queen Gödel Machine (RQGM) sur arXiv. Le système associe un agent de programmation à un évaluateur qui évolue avec lui et note ses correctifs. Sur le benchmark DeepSWE, l’agent de RQGM résout 82.1 % des tâches mises de côté pour l’évaluation, contre 75.0 % pour une référence dotée d’un évaluateur statique. Avec davantage de calcul, ses performances se rapprochent de celles du modèle GPT‑6 Astra. Le cadre réduit aussi d’un facteur trois le coût de la recherche pour des tâches de rédaction scientifique et de notation de preuves.
Pourquoi c'est important
Les développeurs pourraient disposer d’assistants de programmation par IA qui s’améliorent en continu sans dépendre d’une métrique d’évaluation fixe conçue par des humains.