# پژوهش: مدل‌های زبانی هنوز به درخواست‌های خطرناکِ داستانی پاسخ می‌دهند

> پژوهشگران دریافتند مدل‌های Qwen3 و GLM‑4 در ۹۰ تا ۹۶ درصد موارد، به درخواست‌های خطرناکی که در قالب داستان مطرح می‌شوند پاسخ می‌دهند و روشی دفاعی به نام AXIS پیشنهاد کردند.

Oossa · 2026-10-09 · https://oossa.com/fa/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

گروهی به سرپرستی ژانکای یه، بنچمارکی به نام GUISE منتشر کردند که می‌سنجد مدل‌های زبانی بزرگ (LLM) در برابر درخواست‌های خطرناکی که در قالب نقش‌آفرینی یا داستان پنهان شده‌اند، تا چه اندازه از پاسخ‌گویی خودداری می‌کنند. مدل Qwen3‑1.7B در زبان انگلیسی به ۸۹٫۴ درصد از این درخواست‌ها پاسخ داد؛ این میزان در چینی امروزی به ۹۳٫۰ درصد و در چینی کلاسیک به ۹۵٫۷ درصد رسید. پژوهشگران همچنین روشی دفاعی به نام AXIS معرفی کردند که تنظیم ترجیحی را با دو هدف آموزشی جدید ترکیب می‌کند. AXIS در سه مدل Qwen3‑1.7B، Qwen3‑4B و GLM‑4‑9B، بهترین توازن را میان امتیازهای ایمنی و کاربردپذیری به دست آورد.

## حقایق

- موفقیت حمله به Qwen3‑1.7B: ۸۹٫۴ درصد (انگلیسی)، ۹۳٫۰ درصد (چینی امروزی)، ۹۵٫۷ درصد (چینی کلاسیک)
- AXIS امتیازهای ایمنی و کاربردپذیری را در Qwen3‑1.7B، Qwen3‑4B و GLM‑4‑9B بهبود می‌دهد

## چرا مهم است

اگر از مدل‌های زبانی بزرگ در چت‌بات‌ها یا دستیارها استفاده شود، ترفندهای داستانی همچنان ممکن است آن‌ها را به ارائه توصیه‌های خطرناک وادار کند؛ بنابراین به روش‌های دفاعی بهتری مانند AXIS نیاز است.

## منابع و ارجاع‌ها

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

آخرین به‌روزرسانی: 2026-10-09
