Oossa

دراسة: النماذج اللغوية تستجيب لطلبات ضارة داخل القصص

وجد الباحثون أن نماذج Qwen3 وGLM‑4 تستجيب لـ90%‑96% من الطلبات الخطرة عند صياغتها داخل قصص، واقترحوا دفاعًا جديدًا باسم AXIS.

خبر موجزبقلم نشرته Oossa: 1 دقائق قراءة

أصدر فريق بقيادة Zhankai Ye معيارًا اختباريًا باسم GUISE لقياس مدى رفض النماذج اللغوية الكبيرة (LLMs) للطلبات الضارة عندما تُخفى داخل تمثيل أدوار أو قصة. بلغت نسبة استجابة Qwen3‑1.7B لهذه الطلبات 89.4% بالإنجليزية، و93.0% بالصينية الحديثة، وارتفعت إلى 95.7% بالصينية الكلاسيكية. كما قدّم الباحثون طريقة دفاع أطلقوا عليها AXIS، تجمع بين ضبط التفضيلات وهدفين تدريبيين جديدين. ومن بين ثلاثة نماذج هي Qwen3‑1.7B وQwen3‑4B وGLM‑4‑9B، حققت AXIS أفضل توازن بين السلامة وسهولة الاستخدام.

لماذا يهم

إذا استُخدمت النماذج اللغوية في روبوتات المحادثة أو المساعدات، فقد تدفعها الحيل السردية إلى تقديم نصائح ضارة؛ لذا تبرز الحاجة إلى وسائل دفاع أفضل مثل AXIS.

هل كان هذا المقال مفيدًا؟
مشاركة

اقرأ أيضًا

Oossa · النشرة البريدية

أسبوع الذكاء الاصطناعي، مشروحًا

كل يوم اثنين: الأخبار التي تستحق المعرفة، بلغة بسيطة. مجانًا وبلا رسائل مزعجة.