Oossa

پژوهش: مدل‌های زبانی هنوز به درخواست‌های خطرناکِ داستانی پاسخ می‌دهند

پژوهشگران دریافتند مدل‌های Qwen3 و GLM‑4 در ۹۰ تا ۹۶ درصد موارد، به درخواست‌های خطرناکی که در قالب داستان مطرح می‌شوند پاسخ می‌دهند و روشی دفاعی به نام AXIS پیشنهاد کردند.

خبر کوتاهنویسنده: منتشرشده توسط Oossa: 1 دقیقه مطالعه

گروهی به سرپرستی ژانکای یه، بنچمارکی به نام GUISE منتشر کردند که می‌سنجد مدل‌های زبانی بزرگ (LLM) در برابر درخواست‌های خطرناکی که در قالب نقش‌آفرینی یا داستان پنهان شده‌اند، تا چه اندازه از پاسخ‌گویی خودداری می‌کنند. مدل Qwen3‑1.7B در زبان انگلیسی به ۸۹٫۴ درصد از این درخواست‌ها پاسخ داد؛ این میزان در چینی امروزی به ۹۳٫۰ درصد و در چینی کلاسیک به ۹۵٫۷ درصد رسید. پژوهشگران همچنین روشی دفاعی به نام AXIS معرفی کردند که تنظیم ترجیحی را با دو هدف آموزشی جدید ترکیب می‌کند. AXIS در سه مدل Qwen3‑1.7B، Qwen3‑4B و GLM‑4‑9B، بهترین توازن را میان امتیازهای ایمنی و کاربردپذیری به دست آورد.

چرا مهم است

اگر از مدل‌های زبانی بزرگ در چت‌بات‌ها یا دستیارها استفاده شود، ترفندهای داستانی همچنان ممکن است آن‌ها را به ارائه توصیه‌های خطرناک وادار کند؛ بنابراین به روش‌های دفاعی بهتری مانند AXIS نیاز است.

آیا این مقاله مفید بود؟
اشتراک‌گذاری

بیشتر بخوانید

Oossa · خبرنامه

هفتهٔ هوش مصنوعی، به زبان ساده

هر دوشنبه: خبرهایی که ارزش دانستن دارند، به زبان ساده. رایگان و بدون هرزنامه.