Исследователи во главе с Alex Iacob представили Red Queen Gödel Machine (RQGM) на arXiv. Система объединяет агента для написания кода с совместно эволюционирующим рецензентом, который оценивает его исправления. На тесте DeepSWE система RQGM решает 82,1% задач из отложенной выборки, тогда как базовая система со статичным оценщиком — 75,0%. При увеличении вычислительных затрат результаты RQGM приближаются к показателям модели GPT‑6 Astra. Кроме того, система втрое сокращает затраты на поиск решений в задачах по научному письму и проверке доказательств.
Почему это важно
Разработчики могут получить ИИ-помощников для программирования, которые постоянно совершенствуются без опоры на фиксированные критерии оценки, написанные человеком.