گروهی به سرپرستی ژانکای یه، بنچمارکی به نام GUISE منتشر کردند که میسنجد مدلهای زبانی بزرگ (LLM) در برابر درخواستهای خطرناکی که در قالب نقشآفرینی یا داستان پنهان شدهاند، تا چه اندازه از پاسخگویی خودداری میکنند. مدل Qwen3‑1.7B در زبان انگلیسی به ۸۹٫۴ درصد از این درخواستها پاسخ داد؛ این میزان در چینی امروزی به ۹۳٫۰ درصد و در چینی کلاسیک به ۹۵٫۷ درصد رسید. پژوهشگران همچنین روشی دفاعی به نام AXIS معرفی کردند که تنظیم ترجیحی را با دو هدف آموزشی جدید ترکیب میکند. AXIS در سه مدل Qwen3‑1.7B، Qwen3‑4B و GLM‑4‑9B، بهترین توازن را میان امتیازهای ایمنی و کاربردپذیری به دست آورد.
چرا مهم است
اگر از مدلهای زبانی بزرگ در چتباتها یا دستیارها استفاده شود، ترفندهای داستانی همچنان ممکن است آنها را به ارائه توصیههای خطرناک وادار کند؛ بنابراین به روشهای دفاعی بهتری مانند AXIS نیاز است.