تیم قرمز داخلی آنتروپیک ۲۹ سپتامبر ۲۰۲۶ گزارشی کوتاه از اجرای آزمون Frontier منتشر کرد. این تیم ۱۰۰ چالش تصادفی بهرهبرداری از فایلهای دودویی را با دو مدل تازه این شرکت، GLM‑5.3 و Claude Mythos Preview، آزمایش کرد. GLM‑5.3 در ۴ درصد تلاشها موفق شد کنترل جریان اجرا را بهطور کامل در دست بگیرد و Claude Mythos Preview در ۶ درصد موارد به این نتیجه رسید. نسخههای پیشین، از جمله Claude Opus 4.6 و GLM‑5.2، در همین آزمون نتوانستند هیچکدام از این حملهها را انجام دهند.
این اعداد چه معنایی دارند؟
منحرفکردن مسیر اجرای برنامه یعنی فریبدادن یک برنامه برای اجرای کدی که مهاجم انتخاب کرده است. در حوزه امنیت، این روشی کلاسیک برای بهدستگرفتن کنترل یک سامانه است. اینکه این مدلها در شماری از آزمایشها میتوانند چنین اکسپلویتهایی بسازند، نشان میدهد آنها درباره کدنویسی سطح پایین بهاندازهای آموختهاند که بتوانند محمولههای حمله عملی تولید کنند. به گفته تیم قرمز، این نخستین بار است که یکی از مدلهای آنها از این آستانه عبور میکند.
اهمیت موضوع برای کاربران عادی
بیشتر مردم هرگز با آزمون بهرهبرداری از فایلهای دودویی روبهرو نمیشوند، اما این نتیجه نشان میدهد دستیارهای هوش مصنوعی آینده، در صورت سوءاستفاده، ممکن است اسکریپتهای قدرتمندتر و بالقوه آسیبزا بنویسند. همچنین تیمهای امنیتی باید کدهای تولیدشده با هوش مصنوعی را با همان احتیاطی بررسی کنند که کدهای نوشتهشده بهدست انسان را بررسی میکنند. فعلاً این توانایی محدود است و فقط در چند درصد موارد دیده میشود، اما از حوزهای تازه برای کارهای ایمنی خبر میدهد.
چرا مهم است
این یافتهها نشان میدهد مدلهای زبانی امروزی میتوانند کدی تولید کنند که عملاً کنترل برنامهها را در دست میگیرد؛ قابلیتی که پیش از این در مدلهای آنتروپیک دیده نشده بود. این موضوع بر نیاز به تدابیر حفاظتی قویتر هنگام استفاده از ابزارهای هوش مصنوعی برای نوشتن یا بازبینی نرمافزار تأکید میکند، هرچند نرخ موفقیت همچنان پایین است.