OossaAI तेज़ी से विकसित हो रहा है। हम इसे आसान भाषा में समझाते हैं।
न्यूज़लेटर

· 1 मिनट पढ़ना

नया मॉडल बताता है कि AI जेलब्रेक हमले कितनी कोशिशों के साथ बढ़ते हैं

Marco Biroli के नेतृत्व में शोधकर्ताओं ने 29 सितंबर 2026 को एक शोधपत्र जारी किया। इसमें एक सरल सूत्र दिया गया है, जिससे अंदाज़ा लगाया जा सकता है कि हमलावर जितने अधिक प्रॉम्प्ट आज़माते हैं, जेलब्रेक की कोशिशें कितनी बार सफल होती हैं।

Oossa · Oossa के बारे में

नया मॉडल बताता है कि AI जेलब्रेक हमले कितनी कोशिशों के साथ बढ़ते हैं
Photo by FlyD on Unsplash

29 सितंबर 2026 को कंप्यूटर वैज्ञानिक Marco Biroli ने arXiv पर “Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking” शीर्षक से एक शोधपत्र पोस्ट किया। इस काम में एक सीधा-सादा “बैरियर मॉडल” पेश किया गया है, जो बताता है कि जब हमलावर दो चीज़ें बढ़ाता है—प्रॉम्प्ट के अलग-अलग रूपों की संख्या (N) और हर रूप पर मिलने वाले जवाबों की संख्या (M)—तो जेलब्रेक हमलों की सफलता दर कैसे बदलती है। यह मॉडल सुरक्षा तंत्रों से जुड़े सिर्फ़ चार मानों का इस्तेमाल करता है, फिर भी अब तक परखे गए हमलों से कहीं बड़े हमलों के नतीजों का अनुमान लगा सकता है।

नया मॉडल क्या करता है?

यह मॉडल मानता है कि हर प्रॉम्प्ट का एक शुरुआती सुरक्षा स्तर होता है और फिर उसमें एक बेतरतीब “बैरियर” जुड़ जाता है, जिसे हमलावर पर्याप्त विविधताएं आज़माकर पार कर सकता है। पांच अलग-अलग भाषा मॉडलों के डेटा के आधार पर इन चार मानों को तय करके लेखकों ने दिखाया कि पांचों की सफलता दर एक ही स्केलिंग वक्र पर आ जाती है। इसका मतलब है कि वे 100 तक प्रॉम्प्ट रूपों वाले प्रयोगों से 10,000 रूपों वाले परिदृश्यों के नतीजों का अनुमान लगा सकते हैं—ऐसा काम जिसे पहले के अध्ययन भरोसेमंद तरीके से नहीं कर पाए थे।

शोधपत्र यह भी देखता है कि जनरेशन तापमान—यानी AI के जवाबों में बेतरतीबी नियंत्रित करने वाला एक सेटिंग—हमले की सफलता को कैसे प्रभावित करता है। इन्हीं चार मानों से लेखक उन तापमानों पर भी सफलता दर का अनुमान लगा सकते हैं, जिनका उन्होंने परीक्षण नहीं किया।

AI सुरक्षा के लिए यह क्यों अहम है

अगर मॉडल के अनुमान सही साबित होते हैं, तो सुरक्षा इंजीनियर अंदाज़ा लगा सकते हैं कि जेलब्रेक की कोशिश के सफल होने की संभावना बढ़ने से पहले हमलावर को प्रॉम्प्ट के कितने रूप आज़माने पड़ेंगे। इससे उन्हें यह तय करने में मदद मिलेगी कि सार्वजनिक API में कितने प्रॉम्प्ट इस्तेमाल करने की अनुमति दी जाए और संदिग्ध पैटर्न पर कितनी कड़ी निगरानी रखी जाए।

यह काम इस दावे को भी चुनौती देता है कि हमले की सफलता N के साथ एक सरल पावर-लॉ संबंध का पालन करती है। तापमान के साथ बदलने वाला अधिक जटिल वक्र दिखाकर यह संकेत देता है कि बचाव के उपायों में सिर्फ़ कोशिशों की संख्या नहीं, बल्कि कई कारकों पर ध्यान देना होगा।

यह क्यों मायने रखता है

यह मॉडल AI डेवलपरों को जल्दी अंदाज़ा लगाने का तरीका देता है कि हमलावरों के लिए सुरक्षा कवच तोड़ना कितना मुश्किल है। इससे API की सीमाएं और निगरानी के साधन तय करने में मदद मिल सकती है। साथ ही, यह चेतावनी देता है कि कोशिशों की संख्या जैसे किसी एक पैमाने पर निर्भर रहने से जेलब्रेक को आसान बनाने वाले दूसरे कारक नज़रअंदाज़ हो सकते हैं।

क्या यह लेख उपयोगी था?

स्रोत और संदर्भ

#स्रोतप्रकाशकतारीखमुख्य बात
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 सित॰ 2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 स्रोत

अंतिम अपडेट:

Oossallms.txt.md

साझा करें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।

नया मॉडल बताता है कि AI जेलब्रेक हमले कितनी कोशिशों के साथ बढ़ते हैं – Oossa