أصدر فريق بقيادة Zhankai Ye معيارًا اختباريًا باسم GUISE لقياس مدى رفض النماذج اللغوية الكبيرة (LLMs) للطلبات الضارة عندما تُخفى داخل تمثيل أدوار أو قصة. بلغت نسبة استجابة Qwen3‑1.7B لهذه الطلبات 89.4% بالإنجليزية، و93.0% بالصينية الحديثة، وارتفعت إلى 95.7% بالصينية الكلاسيكية. كما قدّم الباحثون طريقة دفاع أطلقوا عليها AXIS، تجمع بين ضبط التفضيلات وهدفين تدريبيين جديدين. ومن بين ثلاثة نماذج هي Qwen3‑1.7B وQwen3‑4B وGLM‑4‑9B، حققت AXIS أفضل توازن بين السلامة وسهولة الاستخدام.
لماذا يهم
إذا استُخدمت النماذج اللغوية في روبوتات المحادثة أو المساعدات، فقد تدفعها الحيل السردية إلى تقديم نصائح ضارة؛ لذا تبرز الحاجة إلى وسائل دفاع أفضل مثل AXIS.