Oossaهوش مصنوعی به‌سرعت پیشرفت می‌کند. ما آن را ساده توضیح می‌دهیم.
خبرنامه

· 1 دقیقه مطالعه

مدل جدید پیش‌بینی می‌کند حملات جیلبریک هوش مصنوعی با افزایش تلاش‌ها چگونه مقیاس می‌گیرند

پژوهشگران به سرپرستی مارکو بی‌رولی در ۲۹ سپتامبر ۲۰۲۶ مقاله‌ای منتشر کردند که فرمولی ساده برای برآورد میزان موفقیت تلاش‌های جیلبریک، با افزایش تعداد پرامپت‌های مهاجمان، ارائه می‌دهد.

Oossa · درباره Oossa

مدل جدید پیش‌بینی می‌کند حملات جیلبریک هوش مصنوعی با افزایش تلاش‌ها چگونه مقیاس می‌گیرند
Photo by FlyD on Unsplash

در ۲۹ سپتامبر ۲۰۲۶، مارکو بی‌رولی، دانشمند علوم رایانه، مقاله‌ای با عنوان «گریز از هم‌راستاسازی: مدلی مبتنی بر تله فیزیکی برای جیلبریک Best-of-N» در arXiv منتشر کرد. این پژوهش «مدل مانع» ساده‌ای معرفی می‌کند که توضیح می‌دهد با افزایش دو متغیر از سوی مهاجم، نرخ موفقیت حملات جیلبریک چه تغییری می‌کند: تعداد گونه‌های پرامپت (N) و تعداد پاسخ‌ها به‌ازای هر گونه (M). این مدل فقط از چهار عدد مرتبط با سازوکارهای ایمنی استفاده می‌کند، اما می‌تواند پیامد حملاتی بسیار بزرگ‌تر از آنچه تاکنون آزمایش شده را پیش‌بینی کند.

مدل جدید چه کاری انجام می‌دهد؟

این مدل برای هر پرامپت یک سطح ایمنی پایه در نظر می‌گیرد و سپس یک «مانع» تصادفی به آن می‌افزاید؛ مهاجم با آزمودن تعداد کافی از گونه‌های مختلف می‌تواند از این مانع عبور کند. نویسندگان با برازش این چهار عدد به داده‌های پنج مدل زبانی مختلف نشان می‌دهند که نتایج هر پنج مدل روی یک منحنی مقیاس‌پذیری واحد قرار می‌گیرد. یعنی می‌توان از آزمایش‌هایی با حداکثر ۱۰۰ گونه پرامپت، وضعیت‌هایی با ۱۰٬۰۰۰ گونه را برآورد کرد؛ کاری که پژوهش‌های پیشین نمی‌توانستند با اطمینان انجام دهند.

مقاله همچنین بررسی می‌کند که دمای تولید ــ پارامتری که میزان تصادفی‌بودن خروجی هوش مصنوعی را کنترل می‌کند ــ چه اثری بر موفقیت حمله دارد. نویسندگان با استفاده از همان چهار عدد می‌توانند نرخ موفقیت را در دماهایی پیش‌بینی کنند که هرگز آزمایش نشده‌اند.

اهمیت این موضوع برای ایمنی هوش مصنوعی

اگر پیش‌بینی‌های مدل درست از آب درآید، مهندسان ایمنی می‌توانند برآورد کنند مهاجم پیش از آنکه احتمال موفقیت جیلبریک بالا برود، به چند گونه پرامپت نیاز دارد. این برآورد به آن‌ها کمک می‌کند محدودیت‌های واقع‌بینانه‌ای برای میزان پرامپت‌دادن در APIهای عمومی تعیین کنند یا الگوهای مشکوک را با جدیت بیشتری زیر نظر بگیرند.

این پژوهش همچنین ادعاهای پیشین را به چالش می‌کشد که می‌گفتند موفقیت حمله با N از یک رابطه ساده قانون توانی پیروی می‌کند. نمایش منحنی‌ای پیچیده‌تر که به دما هم وابسته است، نشان می‌دهد دفاع‌ها باید چندین عامل را در نظر بگیرند، نه فقط تعداد دفعات تلاش را.

چرا مهم است

این مدل راهی سریع در اختیار توسعه‌دهندگان هوش مصنوعی می‌گذارد تا دشواری عبور مهاجمان از تدابیر ایمنی را ارزیابی کنند و بر همان اساس محدودیت‌های API و ابزارهای پایش را تنظیم کنند. همچنین هشدار می‌دهد که تکیه بر یک معیار واحد، مانند تعداد تلاش‌ها، ممکن است عوامل دیگری را که جیلبریک را آسان‌تر می‌کنند نادیده بگیرد.

آیا این مقاله مفید بود؟

منابع و ارجاع‌ها

#منبعرسانهتاریخنکته اصلی
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv۷ مهر ۱۴۰۵arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 منبع

آخرین به‌روزرسانی:

Oossallms.txt.md

اشتراک‌گذاری

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.