Zhankai Ye के नेतृत्व वाली एक टीम ने GUISE नाम का बेंचमार्क जारी किया है। यह जांचता है कि बड़े भाषा मॉडल (LLM) भूमिका-अभिनय या कहानी के भीतर छिपे हानिकारक अनुरोधों को कैसे अस्वीकार करते हैं। अंग्रेज़ी में Qwen3‑1.7B ने ऐसे 89.4% अनुरोधों का जवाब दिया; आधुनिक चीनी में यह दर 93.0% और शास्त्रीय चीनी में 95.7% रही। लेखकों ने AXIS नाम की एक बचाव विधि भी पेश की, जो वरीयता-आधारित ट्यूनिंग को दो नए प्रशिक्षण उद्देश्यों के साथ जोड़ती है। तीन मॉडलों—Qwen3‑1.7B, Qwen3‑4B और GLM‑4‑9B—पर AXIS ने सुरक्षा और उपयोगिता के स्कोर का सबसे अच्छा संतुलन दिया।
यह क्यों मायने रखता है
अगर LLM का इस्तेमाल चैटबॉट या सहायक के तौर पर किया जाता है, तो कहानी में लपेटकर पूछे गए सवाल अब भी उनसे हानिकारक सलाह दिलवा सकते हैं। इसलिए AXIS जैसे बेहतर बचाव तरीकों की ज़रूरत है।