# 에이전트와 평가자가 함께 진화하는 ‘레드 퀸 괴델 머신’

> 새로운 진화 프레임워크가 AI 에이전트와 학습된 평가자를 나란히 개선해, 벤치마크 코딩 성공률을 75%에서 82%로 끌어올렸다.

Oossa · 2026-10-09 · https://oossa.com/ko/red-queen-godel-machine-lets-agents-and-evaluators-evolve-together

Alex Iacob이 이끄는 연구진이 arXiv에 레드 퀸 괴델 머신(RQGM)을 공개했다. 이 시스템은 코딩 에이전트와 에이전트가 만든 패치를 평가하는 공동 진화형 검토자를 짝지운다. DeepSWE 벤치마크에서 RQGM 코더는 학습에 사용되지 않은 작업의 82.1%를 해결했다. 반면 평가자를 고정한 기준 모델의 성공률은 75.0%였다. 더 많은 연산을 투입했을 때 RQGM의 성능은 GPT-6 Astra 모델에 근접했다. 이 프레임워크는 과학 글쓰기와 증명 채점 작업의 탐색 비용도 3분의 1로 줄인다.

## 팩트

- 논문은 2026-10-09(“Fri Oct 09 2026”) arXiv에 게시됐다.
- DeepSWE에서 코더의 작업 성공률은 82.1%로, 기준 모델의 75.0%보다 높았다.

## 왜 중요한가

개발자는 사람이 작성한 고정 평가 지표에 의존하지 않고도 계속 개선되는 AI 코딩 보조 도구를 사용할 수 있다.

## 출처 및 참고 자료

1. [The Red Queen G\"odel Machine: Co-Evolving Agents and Their Evaluators](https://arxiv.org/abs/2606.26294) – arXiv cs.MA, 2026-10-09

최종 업데이트: 2026-10-09
