Oossa

अध्ययन: कहानी में छिपे खतरनाक अनुरोधों का जवाब देते हैं भाषा मॉडल

शोधकर्ताओं के मुताबिक, कहानी के रूप में पेश किए जाने पर Qwen3 और GLM‑4 मॉडल 90%‑96% खतरनाक अनुरोधों का जवाब देते हैं। उन्होंने AXIS नाम का नया बचाव तरीका भी सुझाया है।

संक्षिप्तलेखक: Oossa द्वारा प्रकाशित: 1 मिनट पढ़ना

Zhankai Ye के नेतृत्व वाली एक टीम ने GUISE नाम का बेंचमार्क जारी किया है। यह जांचता है कि बड़े भाषा मॉडल (LLM) भूमिका-अभिनय या कहानी के भीतर छिपे हानिकारक अनुरोधों को कैसे अस्वीकार करते हैं। अंग्रेज़ी में Qwen3‑1.7B ने ऐसे 89.4% अनुरोधों का जवाब दिया; आधुनिक चीनी में यह दर 93.0% और शास्त्रीय चीनी में 95.7% रही। लेखकों ने AXIS नाम की एक बचाव विधि भी पेश की, जो वरीयता-आधारित ट्यूनिंग को दो नए प्रशिक्षण उद्देश्यों के साथ जोड़ती है। तीन मॉडलों—Qwen3‑1.7B, Qwen3‑4B और GLM‑4‑9B—पर AXIS ने सुरक्षा और उपयोगिता के स्कोर का सबसे अच्छा संतुलन दिया।

यह क्यों मायने रखता है

अगर LLM का इस्तेमाल चैटबॉट या सहायक के तौर पर किया जाता है, तो कहानी में लपेटकर पूछे गए सवाल अब भी उनसे हानिकारक सलाह दिलवा सकते हैं। इसलिए AXIS जैसे बेहतर बचाव तरीकों की ज़रूरत है।

क्या यह लेख उपयोगी था?
साझा करें

यह भी पढ़ें

Oossa · न्यूज़लेटर

AI का हफ़्ता, आसान भाषा में

हर सोमवार: जानने लायक खबरें, सरल भाषा में। मुफ़्त, कोई स्पैम नहीं।