# Dil modelleri, hikâyeye sarılmış zararlı isteklere hâlâ yanıt veriyor

> Araştırmacılar, Qwen3 ve GLM‑4 modellerinin anlatı içine yerleştirilen tehlikeli istemlerin %90‑96’sını yanıtladığını ortaya koydu ve AXIS adlı yeni bir savunma yöntemi önerdi.

Oossa · 2026-10-09 · https://oossa.com/tr/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Zhankai Ye’nin liderliğindeki bir ekip, büyük dil modellerinin (LLM’ler) rol yapma senaryosu ya da hikâye içine gizlenmiş zararlı isteklere karşı ne sıklıkla yanıt vermeyi reddettiğini ölçen GUISE adlı bir kıyaslama testi yayımladı. Qwen3‑1.7B, İngilizce istemlerin %89.4’ünü yanıtladı; bu oran modern Çincede %93.0’a, Klasik Çincede ise %95.7’ye çıktı. Yazarlar ayrıca, tercih ayarını iki yeni eğitim hedefiyle birleştiren AXIS adlı bir savunma yöntemi geliştirdi. Qwen3‑1.7B, Qwen3‑4B ve GLM‑4‑9B olmak üzere üç modelde AXIS, güvenlik ve kullanılabilirlik puanları açısından en iyi dengeyi sağladı.

## Gerçekler

- Qwen3‑1.7B’ye yönelik saldırıların başarı oranı: İngilizcede %89.4, modern Çincede %93.0, Klasik Çincede %95.7
- AXIS, Qwen3‑1.7B, Qwen3‑4B ve GLM‑4‑9B modellerinde güvenlik ve kullanılabilirlik puanlarını iyileştiriyor

## Neden önemli

LLM’ler sohbet botlarında veya asistanlarda kullanıldığında, anlatı oyunları modellerin hâlâ zararlı tavsiyeler vermesine yol açabilir. Bu nedenle AXIS gibi daha etkili savunma yöntemlerine ihtiyaç var.

## Kaynaklar ve referanslar

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Son güncelleme: 2026-10-09
