· 1 دقائق قراءة
نموذج جديد يتنبأ بكيفية تصاعد هجمات كسر قيود الذكاء الاصطناعي مع زيادة الجهد
نشر باحثون بقيادة ماركو بيرولي ورقة بحثية في 29 سبتمبر 2026، تقدم معادلة بسيطة لتقدير معدل نجاح محاولات كسر القيود، مع زيادة عدد المطالبات التي يجربها المهاجمون.
Oossa · عن Oossa
في 29 سبتمبر 2026، نشر عالم الحاسوب ماركو بيرولي ورقة بحثية على arXiv بعنوان «الهروب من المواءمة: نموذج فخ فيزيائي لهجمات كسر القيود بأسلوب أفضل نتيجة من بين N». وتقدم الدراسة «نموذج الحاجز» المباشر، الذي يشرح كيف يتغير معدل نجاح هجمات كسر القيود عندما يزيد المهاجم متغيرين: عدد صيغ المطالبات (N) وعدد الردود لكل صيغة (M). ولا يحتاج النموذج سوى أربعة أرقام مرتبطة بآليات السلامة، ومع ذلك يمكنه التنبؤ بنتائج هجمات أوسع بكثير من تلك التي اختُبرت حتى الآن.
ما الذي يفعله النموذج الجديد؟
يتعامل النموذج مع كل مطالبة على أن لها مستوى سلامة أساسيًا، ثم يضيف «حاجزًا» عشوائيًا يمكن تجاوزه إذا جرّب المهاجم عددًا كافيًا من الصيغ. ومن خلال مواءمة الأرقام الأربعة مع بيانات خمسة نماذج لغوية مختلفة، يبيّن الباحثون أن نتائج النماذج الخمسة كلها تقع على منحنى التدرج نفسه. وهذا يعني إمكانية الاستقراء من تجارب شملت ما يصل إلى 100 صيغة للمطالبة إلى سيناريوهات تضم 10,000 صيغة، وهو أمر لم تتمكن الدراسات السابقة من فعله على نحو موثوق.
وتبحث الورقة أيضًا في تأثير درجة التوليد – وهي إعداد يتحكم في عشوائية مخرجات الذكاء الاصطناعي – على نجاح الهجمات. وباستخدام الأرقام الأربعة نفسها، يستطيع الباحثون التنبؤ بمعدلات النجاح عند درجات حرارة لم يختبروها قط.
أهمية ذلك لسلامة الذكاء الاصطناعي
إذا صمدت تنبؤات النموذج أمام الاختبار، فسيتمكن مهندسو السلامة من تقدير عدد صيغ المطالبات التي يحتاج إليها المهاجم قبل أن يصبح كسر القيود مرجحًا. ويساعدهم ذلك على وضع حدود واقعية لعدد المطالبات المسموح بها عبر واجهات البرمجة العامة، أو على تحديد مدى تشدد مراقبة الأنماط المريبة.
كما تتحدى الدراسة ادعاءات سابقة بأن نجاح الهجمات يتبع علاقة بسيطة وفق قانون القوة مع N. وبإظهار منحنى أكثر تعقيدًا يتغير بحسب درجة الحرارة، تشير الدراسة إلى أن على وسائل الدفاع أخذ عوامل متعددة في الحسبان، لا عدد المحاولات وحده.
لماذا يهم
يمنح النموذج مطوري الذكاء الاصطناعي وسيلة سريعة لتقدير مدى صعوبة تجاوز المهاجمين لضوابط السلامة، ما قد يساعد في تحديد حدود واجهات البرمجة وأدوات المراقبة. كما يحذر من أن الاعتماد على مقياس واحد، مثل عدد المحاولات، قد يغفل عوامل أخرى تجعل كسر القيود أسهل.
المصادر والمراجع
| # | المصدر | الجهة الناشرة | التاريخ | الخلاصة |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 29/09/2026 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 مصادر
آخر تحديث:
Oossa · النشرة البريدية
أسبوع الذكاء الاصطناعي، مشروحًا
كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.