Un equipo de investigadores encabezado por Alex Iacob publicó en arXiv Red Queen Gödel Machine (RQGM). El sistema combina un agente de programación con un revisor que evoluciona junto a él y evalúa sus parches. En la prueba DeepSWE, el agente de RQGM resuelve el 82.1% de las tareas reservadas para evaluación, frente al 75.0% de una versión de referencia con un evaluador estático. Con un mayor esfuerzo, el rendimiento de RQGM se acerca al del modelo GPT‑6 Astra. El marco también reduce a un tercio el costo de búsqueda en tareas de redacción científica y evaluación de demostraciones matemáticas.
Por qué importa
Los desarrolladores podrían contar con asistentes de programación de IA que mejoren continuamente sin depender de una métrica de evaluación fija, escrita por humanos.