# Taalmodellen beantwoorden nog steeds schadelijke verzoeken in verhalen

> Onderzoekers ontdekten dat Qwen3- en GLM‑4-modellen 90%‑96% van de gevaarlijke prompts beantwoorden als die in een verhaal zijn verpakt. Ze stellen een nieuwe verdediging voor: AXIS.

Oossa · 2026-10-09 · https://oossa.com/nl/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Een team onder leiding van Zhankai Ye bracht een benchmark uit met de naam GUISE. Die test hoe vaak grote taalmodellen (LLM’s) schadelijke verzoeken weigeren als die verborgen zitten in een rollenspel of verhaal. In het Engels beantwoordde Qwen3‑1.7B 89.4% van zulke prompts; in modern Chinees was dat 93.0% en in klassiek Chinees liep het percentage op tot 95.7%. De onderzoekers introduceerden ook een verdedigingsmethode met de naam AXIS, die voorkeurstuning combineert met twee nieuwe trainingsdoelen. Van drie modellen — Qwen3‑1.7B, Qwen3‑4B en GLM‑4‑9B — leverde AXIS de beste combinatie van veiligheid en gebruiksgemak op.

## De feiten

- Succespercentage van aanvallen op Qwen3‑1.7B: 89.4% (Engels), 93.0% (modern Chinees), 95.7% (klassiek Chinees)
- AXIS verbetert de scores voor veiligheid en gebruiksgemak op Qwen3‑1.7B, Qwen3‑4B en GLM‑4‑9B

## Waarom het ertoe doet

Als LLM’s in chatbots of assistenten worden gebruikt, kunnen verhalen ze er nog steeds toe verleiden schadelijk advies te geven. Daarom zijn betere verdedigingsmethoden zoals AXIS nodig.

## Bronnen en referenties

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Laatst bijgewerkt: 2026-10-09
