# مدل جدید پیش‌بینی می‌کند حملات جیلبریک هوش مصنوعی با افزایش تلاش‌ها چگونه مقیاس می‌گیرند

> پژوهشگران به سرپرستی مارکو بی‌رولی در ۲۹ سپتامبر ۲۰۲۶ مقاله‌ای منتشر کردند که فرمولی ساده برای برآورد میزان موفقیت تلاش‌های جیلبریک، با افزایش تعداد پرامپت‌های مهاجمان، ارائه می‌دهد.

Oossa · 2026-09-29 · https://oossa.com/fa/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

در ۲۹ سپتامبر ۲۰۲۶، مارکو بی‌رولی، دانشمند علوم رایانه، مقاله‌ای با عنوان «گریز از هم‌راستاسازی: مدلی مبتنی بر تله فیزیکی برای جیلبریک Best-of-N» در arXiv منتشر کرد. این پژوهش «مدل مانع» ساده‌ای معرفی می‌کند که توضیح می‌دهد با افزایش دو متغیر از سوی مهاجم، نرخ موفقیت حملات جیلبریک چه تغییری می‌کند: تعداد گونه‌های پرامپت (N) و تعداد پاسخ‌ها به‌ازای هر گونه (M). این مدل فقط از چهار عدد مرتبط با سازوکارهای ایمنی استفاده می‌کند، اما می‌تواند پیامد حملاتی بسیار بزرگ‌تر از آنچه تاکنون آزمایش شده را پیش‌بینی کند.

## مدل جدید چه کاری انجام می‌دهد؟

این مدل برای هر پرامپت یک سطح ایمنی پایه در نظر می‌گیرد و سپس یک «مانع» تصادفی به آن می‌افزاید؛ مهاجم با آزمودن تعداد کافی از گونه‌های مختلف می‌تواند از این مانع عبور کند. نویسندگان با برازش این چهار عدد به داده‌های پنج مدل زبانی مختلف نشان می‌دهند که نتایج هر پنج مدل روی یک منحنی مقیاس‌پذیری واحد قرار می‌گیرد. یعنی می‌توان از آزمایش‌هایی با حداکثر ۱۰۰ گونه پرامپت، وضعیت‌هایی با ۱۰٬۰۰۰ گونه را برآورد کرد؛ کاری که پژوهش‌های پیشین نمی‌توانستند با اطمینان انجام دهند.

مقاله همچنین بررسی می‌کند که دمای تولید ــ پارامتری که میزان تصادفی‌بودن خروجی هوش مصنوعی را کنترل می‌کند ــ چه اثری بر موفقیت حمله دارد. نویسندگان با استفاده از همان چهار عدد می‌توانند نرخ موفقیت را در دماهایی پیش‌بینی کنند که هرگز آزمایش نشده‌اند.

## اهمیت این موضوع برای ایمنی هوش مصنوعی

اگر پیش‌بینی‌های مدل درست از آب درآید، مهندسان ایمنی می‌توانند برآورد کنند مهاجم پیش از آنکه احتمال موفقیت جیلبریک بالا برود، به چند گونه پرامپت نیاز دارد. این برآورد به آن‌ها کمک می‌کند محدودیت‌های واقع‌بینانه‌ای برای میزان پرامپت‌دادن در APIهای عمومی تعیین کنند یا الگوهای مشکوک را با جدیت بیشتری زیر نظر بگیرند.

این پژوهش همچنین ادعاهای پیشین را به چالش می‌کشد که می‌گفتند موفقیت حمله با N از یک رابطه ساده قانون توانی پیروی می‌کند. نمایش منحنی‌ای پیچیده‌تر که به دما هم وابسته است، نشان می‌دهد دفاع‌ها باید چندین عامل را در نظر بگیرند، نه فقط تعداد دفعات تلاش را.

## حقایق

- این مقاله در ۲۹ سپتامبر ۲۰۲۶ در arXiv منتشر شد.
- مارکو بی‌رولی به‌عنوان تنها نویسنده این پژوهش معرفی شده است.
- این مدل با استفاده از فقط چهار پارامتر مرتبط با ایمنی، داده‌های پنج مدل زبانی مختلف را برازش می‌کند.
- مدل می‌تواند نرخ موفقیت حمله را از N ≤ ۱۰۰ تا N = ۱۰⁴ گونه پرامپت برون‌یابی کند.
- نویسندگان دریافته‌اند که توانِ نرخ موفقیت با تغییر N تغییر می‌کند؛ یافته‌ای که فرض ساده قانون توانی را نقض می‌کند.

## چرا مهم است

این مدل راهی سریع در اختیار توسعه‌دهندگان هوش مصنوعی می‌گذارد تا دشواری عبور مهاجمان از تدابیر ایمنی را ارزیابی کنند و بر همان اساس محدودیت‌های API و ابزارهای پایش را تنظیم کنند. همچنین هشدار می‌دهد که تکیه بر یک معیار واحد، مانند تعداد تلاش‌ها، ممکن است عوامل دیگری را که جیلبریک را آسان‌تر می‌کنند نادیده بگیرد.

## منابع و ارجاع‌ها

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

آخرین به‌روزرسانی: 2026-09-29
