Oossa

Taalmodellen beantwoorden nog steeds schadelijke verzoeken in verhalen

Onderzoekers ontdekten dat Qwen3- en GLM‑4-modellen 90%‑96% van de gevaarlijke prompts beantwoorden als die in een verhaal zijn verpakt. Ze stellen een nieuwe verdediging voor: AXIS.

Kort berichtDoor Gepubliceerd door Oossa: 1 min lezen

Een team onder leiding van Zhankai Ye bracht een benchmark uit met de naam GUISE. Die test hoe vaak grote taalmodellen (LLM’s) schadelijke verzoeken weigeren als die verborgen zitten in een rollenspel of verhaal. In het Engels beantwoordde Qwen3‑1.7B 89.4% van zulke prompts; in modern Chinees was dat 93.0% en in klassiek Chinees liep het percentage op tot 95.7%. De onderzoekers introduceerden ook een verdedigingsmethode met de naam AXIS, die voorkeurstuning combineert met twee nieuwe trainingsdoelen. Van drie modellen — Qwen3‑1.7B, Qwen3‑4B en GLM‑4‑9B — leverde AXIS de beste combinatie van veiligheid en gebruiksgemak op.

Waarom het ertoe doet

Als LLM’s in chatbots of assistenten worden gebruikt, kunnen verhalen ze er nog steeds toe verleiden schadelijk advies te geven. Daarom zijn betere verdedigingsmethoden zoals AXIS nodig.

Was dit artikel nuttig?
Delen

Lees ook

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.