نشر الفريق الأحمر الداخلي في Anthropic موجزًا عن اختبار Frontier الذي أجراه في 29 سبتمبر 2026. واختبر الفريق نموذجين من أحدث نماذج الشركة، هما GLM‑5.3 وClaude Mythos Preview، على 100 تحدٍ عشوائي لاستغلال الثغرات الثنائية. وتمكن GLM‑5.3 من اختطاف تدفق التحكم بالكامل في 4٪ من المحاولات، فيما نجح Claude Mythos Preview في 6٪ منها. أما الإصدارات السابقة، مثل Claude Opus 4.6 وGLM‑5.2، فلم تنجح في أي عملية اختطاف في الاختبار نفسه.
ماذا تعني هذه الأرقام؟
يحدث اختطاف تدفق التحكم عندما يُخدع برنامج ليشغّل شيفرة يختارها المهاجم. وفي المصطلحات الأمنية، تُعد هذه وسيلة تقليدية للسيطرة على نظام. ويُظهر تمكن هذه النماذج من إنتاج مثل هذه الاستغلالات في عدد قليل من التجارب أنها تعلمت ما يكفي عن الشيفرات منخفضة المستوى لتوليد حمولات هجومية قابلة للتنفيذ. ويقول الفريق الأحمر إن هذه أول مرة يبلغ فيها أي من نماذجه هذا المستوى.
لماذا يهم ذلك المستخدمين؟
لن يواجه معظم الناس اختبارًا لاستغلال الثغرات الثنائية، لكن النتيجة تشير إلى أن مساعدي الذكاء الاصطناعي في المستقبل قد يكتبون نصوصًا برمجية أقوى وربما ضارة إذا أسيء استخدامها. كما تعني أن على فرق الأمن التعامل مع الشيفرات التي يولدها الذكاء الاصطناعي بالحذر نفسه الذي تتعامل به مع الشيفرات التي يكتبها البشر. ولا تزال هذه القدرة محدودة في الوقت الراهن، إذ تظهر في بضعة في المئة فقط من الحالات، لكنها تفتح مجالًا جديدًا للعمل على السلامة.
لماذا يهم
تُظهر هذه النتائج أن نماذج اللغة الحديثة قادرة على توليد شيفرات تسيطر فعليًا على البرامج، وهي قدرة لم يسبق رصدها في نماذج Anthropic. وتشير إلى ضرورة تعزيز الضمانات عند استخدام أدوات الذكاء الاصطناعي لكتابة البرمجيات أو مراجعتها، رغم أن معدل النجاح لا يزال منخفضًا.