Anthropic की आंतरिक रेड-टीम ने 29 सितंबर, 2026 को अपने Frontier परीक्षण के बारे में एक संक्षिप्त रिपोर्ट जारी की। टीम ने अपने दो सबसे नए मॉडलों—GLM-5.3 और Claude Mythos Preview—के सामने बाइनरी एक्सप्लॉइटेशन की 100 यादृच्छिक चुनौतियां रखीं। GLM-5.3 ने 4% प्रयासों में कंट्रोल-फ्लो को पूरी तरह हाइजैक किया, जबकि Claude Mythos Preview 6% प्रयासों में सफल रहा। Claude Opus 4.6 और GLM-5.2 जैसे पुराने मॉडल इसी परीक्षण में एक भी हाइजैक नहीं कर पाए।
इन आंकड़ों का क्या मतलब है
कंट्रोल-फ्लो हाइजैक तब होता है, जब किसी प्रोग्राम को हमलावर के चुने हुए कोड को चलाने के लिए बरगलाया जाता है। साइबर सुरक्षा की भाषा में, यह किसी सिस्टम पर कब्जा करने का एक पारंपरिक तरीका है। इन मॉडलों का कुछ ही परीक्षणों में ऐसे एक्सप्लॉइट तैयार कर पाना दिखाता है कि उन्होंने निचले स्तर के कोड के बारे में इतनी जानकारी सीख ली है कि काम करने वाले हमलावर पेलोड बना सकें। रेड-टीम का कहना है कि उसके किसी मॉडल ने पहली बार यह सीमा पार की है।
आम उपयोगकर्ताओं के लिए यह क्यों मायने रखता है
ज्यादातर लोगों का बाइनरी-एक्सप्लॉइटेशन परीक्षण से कभी सामना नहीं होगा, लेकिन यह नतीजा संकेत देता है कि भविष्य के AI असिस्टेंट दुरुपयोग होने पर ज्यादा ताकतवर और संभावित रूप से नुकसानदेह स्क्रिप्ट लिख सकते हैं। इसका मतलब यह भी है कि सुरक्षा टीमों को AI से बने कोड के साथ उतनी ही सावधानी बरतनी होगी, जितनी इंसानों के लिखे कोड के साथ। फिलहाल यह क्षमता सीमित है—यह कुछ ही प्रतिशत मामलों में दिखती है—लेकिन सुरक्षा के लिहाज से यह काम का एक नया क्षेत्र है।
यह क्यों मायने रखता है
ये नतीजे दिखाते हैं कि आधुनिक भाषा मॉडल ऐसा कोड बना सकते हैं जो वास्तव में प्रोग्रामों का नियंत्रण अपने हाथ में ले लेता है—यह क्षमता Anthropic के मॉडलों में पहले नहीं देखी गई थी। इससे सॉफ्टवेयर लिखने या उसकी समीक्षा करने के लिए AI टूल इस्तेमाल करते समय मजबूत सुरक्षा उपायों की जरूरत का संकेत मिलता है, हालांकि सफलता की दर अभी भी कम है।