نشر باحثون بقيادة أليكس إياكوب إطار «آلة الملكة الحمراء لغودل» (RQGM) على arXiv. ويقرن النظام وكيلًا للبرمجة بمراجع يتطور معه ويقيّم التعديلات البرمجية التي يقترحها. وفي اختبار DeepSWE المعياري، يحلّ وكيل RQGM نسبة 82.1% من المهام المحجوبة، مقابل 75.0% لخط أساس يستخدم مقيّمًا ثابتًا. ومع زيادة الجهد، يقترب أداء RQGM من أداء نموذج GPT‑6 Astra. كما يخفض الإطار تكلفة البحث إلى الثلث في مهام الكتابة العلمية وتقييم البراهين.
لماذا يهم
قد يتيح هذا للمطورين استخدام مساعدين للبرمجة بالذكاء الاصطناعي يواصلون التحسن، من دون الاعتماد على معيار تقييم ثابت يكتبه البشر.