· 1 دقیقه مطالعه
مدل جدید پیشبینی میکند حملات جیلبریک هوش مصنوعی با افزایش تلاشها چگونه مقیاس میگیرند
پژوهشگران به سرپرستی مارکو بیرولی در ۲۹ سپتامبر ۲۰۲۶ مقالهای منتشر کردند که فرمولی ساده برای برآورد میزان موفقیت تلاشهای جیلبریک، با افزایش تعداد پرامپتهای مهاجمان، ارائه میدهد.
Oossa · درباره Oossa
در ۲۹ سپتامبر ۲۰۲۶، مارکو بیرولی، دانشمند علوم رایانه، مقالهای با عنوان «گریز از همراستاسازی: مدلی مبتنی بر تله فیزیکی برای جیلبریک Best-of-N» در arXiv منتشر کرد. این پژوهش «مدل مانع» سادهای معرفی میکند که توضیح میدهد با افزایش دو متغیر از سوی مهاجم، نرخ موفقیت حملات جیلبریک چه تغییری میکند: تعداد گونههای پرامپت (N) و تعداد پاسخها بهازای هر گونه (M). این مدل فقط از چهار عدد مرتبط با سازوکارهای ایمنی استفاده میکند، اما میتواند پیامد حملاتی بسیار بزرگتر از آنچه تاکنون آزمایش شده را پیشبینی کند.
مدل جدید چه کاری انجام میدهد؟
این مدل برای هر پرامپت یک سطح ایمنی پایه در نظر میگیرد و سپس یک «مانع» تصادفی به آن میافزاید؛ مهاجم با آزمودن تعداد کافی از گونههای مختلف میتواند از این مانع عبور کند. نویسندگان با برازش این چهار عدد به دادههای پنج مدل زبانی مختلف نشان میدهند که نتایج هر پنج مدل روی یک منحنی مقیاسپذیری واحد قرار میگیرد. یعنی میتوان از آزمایشهایی با حداکثر ۱۰۰ گونه پرامپت، وضعیتهایی با ۱۰٬۰۰۰ گونه را برآورد کرد؛ کاری که پژوهشهای پیشین نمیتوانستند با اطمینان انجام دهند.
مقاله همچنین بررسی میکند که دمای تولید ــ پارامتری که میزان تصادفیبودن خروجی هوش مصنوعی را کنترل میکند ــ چه اثری بر موفقیت حمله دارد. نویسندگان با استفاده از همان چهار عدد میتوانند نرخ موفقیت را در دماهایی پیشبینی کنند که هرگز آزمایش نشدهاند.
اهمیت این موضوع برای ایمنی هوش مصنوعی
اگر پیشبینیهای مدل درست از آب درآید، مهندسان ایمنی میتوانند برآورد کنند مهاجم پیش از آنکه احتمال موفقیت جیلبریک بالا برود، به چند گونه پرامپت نیاز دارد. این برآورد به آنها کمک میکند محدودیتهای واقعبینانهای برای میزان پرامپتدادن در APIهای عمومی تعیین کنند یا الگوهای مشکوک را با جدیت بیشتری زیر نظر بگیرند.
این پژوهش همچنین ادعاهای پیشین را به چالش میکشد که میگفتند موفقیت حمله با N از یک رابطه ساده قانون توانی پیروی میکند. نمایش منحنیای پیچیدهتر که به دما هم وابسته است، نشان میدهد دفاعها باید چندین عامل را در نظر بگیرند، نه فقط تعداد دفعات تلاش را.
چرا مهم است
این مدل راهی سریع در اختیار توسعهدهندگان هوش مصنوعی میگذارد تا دشواری عبور مهاجمان از تدابیر ایمنی را ارزیابی کنند و بر همان اساس محدودیتهای API و ابزارهای پایش را تنظیم کنند. همچنین هشدار میدهد که تکیه بر یک معیار واحد، مانند تعداد تلاشها، ممکن است عوامل دیگری را که جیلبریک را آسانتر میکنند نادیده بگیرد.
منابع و ارجاعها
| # | منبع | رسانه | تاریخ | نکته اصلی |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | ۷ مهر ۱۴۰۵ | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 منبع
آخرین بهروزرسانی:
Oossa · خبرنامه
هفتهٔ هوش مصنوعی، به زبان ساده
هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.