Zhankai Ye’nin liderliğindeki bir ekip, büyük dil modellerinin (LLM’ler) rol yapma senaryosu ya da hikâye içine gizlenmiş zararlı isteklere karşı ne sıklıkla yanıt vermeyi reddettiğini ölçen GUISE adlı bir kıyaslama testi yayımladı. Qwen3‑1.7B, İngilizce istemlerin %89.4’ünü yanıtladı; bu oran modern Çincede %93.0’a, Klasik Çincede ise %95.7’ye çıktı. Yazarlar ayrıca, tercih ayarını iki yeni eğitim hedefiyle birleştiren AXIS adlı bir savunma yöntemi geliştirdi. Qwen3‑1.7B, Qwen3‑4B ve GLM‑4‑9B olmak üzere üç modelde AXIS, güvenlik ve kullanılabilirlik puanları açısından en iyi dengeyi sağladı.
Neden önemli
LLM’ler sohbet botlarında veya asistanlarda kullanıldığında, anlatı oyunları modellerin hâlâ zararlı tavsiyeler vermesine yol açabilir. Bu nedenle AXIS gibi daha etkili savunma yöntemlerine ihtiyaç var.