Oossa

Dil modelleri, hikâyeye sarılmış zararlı isteklere hâlâ yanıt veriyor

Araştırmacılar, Qwen3 ve GLM‑4 modellerinin anlatı içine yerleştirilen tehlikeli istemlerin %90‑96’sını yanıtladığını ortaya koydu ve AXIS adlı yeni bir savunma yöntemi önerdi.

Kısa haberYazan: Oossa yayın tarihi: 1 dk okuma

Zhankai Ye’nin liderliğindeki bir ekip, büyük dil modellerinin (LLM’ler) rol yapma senaryosu ya da hikâye içine gizlenmiş zararlı isteklere karşı ne sıklıkla yanıt vermeyi reddettiğini ölçen GUISE adlı bir kıyaslama testi yayımladı. Qwen3‑1.7B, İngilizce istemlerin %89.4’ünü yanıtladı; bu oran modern Çincede %93.0’a, Klasik Çincede ise %95.7’ye çıktı. Yazarlar ayrıca, tercih ayarını iki yeni eğitim hedefiyle birleştiren AXIS adlı bir savunma yöntemi geliştirdi. Qwen3‑1.7B, Qwen3‑4B ve GLM‑4‑9B olmak üzere üç modelde AXIS, güvenlik ve kullanılabilirlik puanları açısından en iyi dengeyi sağladı.

Neden önemli

LLM’ler sohbet botlarında veya asistanlarda kullanıldığında, anlatı oyunları modellerin hâlâ zararlı tavsiyeler vermesine yol açabilir. Bu nedenle AXIS gibi daha etkili savunma yöntemlerine ihtiyaç var.

Bu makale faydalı oldu mu?
Paylaş

Sıradaki okuma

Oossa · Bülten

Yapay zekâda hafta, anlaşılır dille

Her pazartesi: bilmeye değer haberler, sade bir dille. Ücretsiz, spam yok.