# नया मॉडल बताता है कि AI जेलब्रेक हमले कितनी कोशिशों के साथ बढ़ते हैं

> Marco Biroli के नेतृत्व में शोधकर्ताओं ने 29 सितंबर 2026 को एक शोधपत्र जारी किया। इसमें एक सरल सूत्र दिया गया है, जिससे अंदाज़ा लगाया जा सकता है कि हमलावर जितने अधिक प्रॉम्प्ट आज़माते हैं, जेलब्रेक की कोशिशें कितनी बार सफल होती हैं।

Oossa · 2026-09-29 · https://oossa.com/hi/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

29 सितंबर 2026 को कंप्यूटर वैज्ञानिक Marco Biroli ने arXiv पर “Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking” शीर्षक से एक शोधपत्र पोस्ट किया। इस काम में एक सीधा-सादा “बैरियर मॉडल” पेश किया गया है, जो बताता है कि जब हमलावर दो चीज़ें बढ़ाता है—प्रॉम्प्ट के अलग-अलग रूपों की संख्या (N) और हर रूप पर मिलने वाले जवाबों की संख्या (M)—तो जेलब्रेक हमलों की सफलता दर कैसे बदलती है। यह मॉडल सुरक्षा तंत्रों से जुड़े सिर्फ़ चार मानों का इस्तेमाल करता है, फिर भी अब तक परखे गए हमलों से कहीं बड़े हमलों के नतीजों का अनुमान लगा सकता है।

## नया मॉडल क्या करता है?

यह मॉडल मानता है कि हर प्रॉम्प्ट का एक शुरुआती सुरक्षा स्तर होता है और फिर उसमें एक बेतरतीब “बैरियर” जुड़ जाता है, जिसे हमलावर पर्याप्त विविधताएं आज़माकर पार कर सकता है। पांच अलग-अलग भाषा मॉडलों के डेटा के आधार पर इन चार मानों को तय करके लेखकों ने दिखाया कि पांचों की सफलता दर एक ही स्केलिंग वक्र पर आ जाती है। इसका मतलब है कि वे 100 तक प्रॉम्प्ट रूपों वाले प्रयोगों से 10,000 रूपों वाले परिदृश्यों के नतीजों का अनुमान लगा सकते हैं—ऐसा काम जिसे पहले के अध्ययन भरोसेमंद तरीके से नहीं कर पाए थे।

शोधपत्र यह भी देखता है कि जनरेशन तापमान—यानी AI के जवाबों में बेतरतीबी नियंत्रित करने वाला एक सेटिंग—हमले की सफलता को कैसे प्रभावित करता है। इन्हीं चार मानों से लेखक उन तापमानों पर भी सफलता दर का अनुमान लगा सकते हैं, जिनका उन्होंने परीक्षण नहीं किया।

## AI सुरक्षा के लिए यह क्यों अहम है

अगर मॉडल के अनुमान सही साबित होते हैं, तो सुरक्षा इंजीनियर अंदाज़ा लगा सकते हैं कि जेलब्रेक की कोशिश के सफल होने की संभावना बढ़ने से पहले हमलावर को प्रॉम्प्ट के कितने रूप आज़माने पड़ेंगे। इससे उन्हें यह तय करने में मदद मिलेगी कि सार्वजनिक API में कितने प्रॉम्प्ट इस्तेमाल करने की अनुमति दी जाए और संदिग्ध पैटर्न पर कितनी कड़ी निगरानी रखी जाए।

यह काम इस दावे को भी चुनौती देता है कि हमले की सफलता N के साथ एक सरल पावर-लॉ संबंध का पालन करती है। तापमान के साथ बदलने वाला अधिक जटिल वक्र दिखाकर यह संकेत देता है कि बचाव के उपायों में सिर्फ़ कोशिशों की संख्या नहीं, बल्कि कई कारकों पर ध्यान देना होगा।

## तथ्य

- यह शोधपत्र 29 सितंबर 2026 को arXiv पर पोस्ट किया गया था।
- इस अध्ययन में Marco Biroli को एकमात्र लेखक के रूप में सूचीबद्ध किया गया है।
- यह मॉडल सुरक्षा से जुड़े सिर्फ़ चार मानों का इस्तेमाल करके पांच अलग-अलग भाषा मॉडलों के डेटा पर फिट किया गया है।
- यह N ≤ 100 से N = 10⁴ प्रॉम्प्ट रूपों तक हमले की सफलता दर का अनुमान लगा सकता है।
- लेखकों के अनुसार, सफलता दर का घातांक N के साथ बदलता है, जो सरल पावर-लॉ की धारणा के विपरीत है।

## यह क्यों मायने रखता है

यह मॉडल AI डेवलपरों को जल्दी अंदाज़ा लगाने का तरीका देता है कि हमलावरों के लिए सुरक्षा कवच तोड़ना कितना मुश्किल है। इससे API की सीमाएं और निगरानी के साधन तय करने में मदद मिल सकती है। साथ ही, यह चेतावनी देता है कि कोशिशों की संख्या जैसे किसी एक पैमाने पर निर्भर रहने से जेलब्रेक को आसान बनाने वाले दूसरे कारक नज़रअंदाज़ हो सकते हैं।

## स्रोत और संदर्भ

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

अंतिम अपडेट: 2026-09-29
