Ein Forschungsteam unter der Leitung von Alex Iacob hat die Red Queen Gödel Machine (RQGM) auf arXiv veröffentlicht. Das System kombiniert einen Programmieragenten mit einem gemeinsam weiterentwickelten Prüfer, der dessen Codeänderungen bewertet. Beim DeepSWE-Benchmark löst der RQGM-Programmieragent 82,1 % der Aufgaben aus dem Testsatz, während ein Vergleichssystem mit festem Prüfer 75,0 % erreicht. Bei höherem Rechenaufwand liegt die Leistung der RQGM nahe am Modell GPT‑6 Astra. Für Aufgaben zum wissenschaftlichen Schreiben und zur Bewertung von Beweisen senkt das Verfahren die Suchkosten außerdem auf ein Drittel.
Warum es wichtig ist
Entwickler könnten KI-Programmierassistenten erhalten, die sich kontinuierlich verbessern, ohne auf eine feste, von Menschen formulierte Bewertungsmetrik angewiesen zu sein.