# अध्ययन: कहानी में छिपे खतरनाक अनुरोधों का जवाब देते हैं भाषा मॉडल

> शोधकर्ताओं के मुताबिक, कहानी के रूप में पेश किए जाने पर Qwen3 और GLM‑4 मॉडल 90%‑96% खतरनाक अनुरोधों का जवाब देते हैं। उन्होंने AXIS नाम का नया बचाव तरीका भी सुझाया है।

Oossa · 2026-10-09 · https://oossa.com/hi/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Zhankai Ye के नेतृत्व वाली एक टीम ने GUISE नाम का बेंचमार्क जारी किया है। यह जांचता है कि बड़े भाषा मॉडल (LLM) भूमिका-अभिनय या कहानी के भीतर छिपे हानिकारक अनुरोधों को कैसे अस्वीकार करते हैं। अंग्रेज़ी में Qwen3‑1.7B ने ऐसे 89.4% अनुरोधों का जवाब दिया; आधुनिक चीनी में यह दर 93.0% और शास्त्रीय चीनी में 95.7% रही। लेखकों ने AXIS नाम की एक बचाव विधि भी पेश की, जो वरीयता-आधारित ट्यूनिंग को दो नए प्रशिक्षण उद्देश्यों के साथ जोड़ती है। तीन मॉडलों—Qwen3‑1.7B, Qwen3‑4B और GLM‑4‑9B—पर AXIS ने सुरक्षा और उपयोगिता के स्कोर का सबसे अच्छा संतुलन दिया।

## तथ्य

- Qwen3‑1.7B पर हमले की सफलता दर: 89.4% (अंग्रेज़ी), 93.0% (आधुनिक चीनी), 95.7% (शास्त्रीय चीनी)
- AXIS ने Qwen3‑1.7B, Qwen3‑4B और GLM‑4‑9B के सुरक्षा और उपयोगिता स्कोर में सुधार किया

## यह क्यों मायने रखता है

अगर LLM का इस्तेमाल चैटबॉट या सहायक के तौर पर किया जाता है, तो कहानी में लपेटकर पूछे गए सवाल अब भी उनसे हानिकारक सलाह दिलवा सकते हैं। इसलिए AXIS जैसे बेहतर बचाव तरीकों की ज़रूरत है।

## स्रोत और संदर्भ

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

अंतिम अपडेट: 2026-10-09
