Oossa

Studie: språkmodeller svarar på skadliga frågor i berättelser

Forskarna fann att modellerna Qwen3 och GLM‑4 svarar på 90–96 % av de farliga frågorna när de bäddas in i berättelser. De föreslår också ett nytt skydd, AXIS.

NotisAv Publicerad av Oossa: 1 min läsning

Ett team lett av Zhankai Ye har släppt ett test, GUISE, som undersöker hur stora språkmodeller (LLM:er) avböjer skadliga förfrågningar när de döljs i rollspel eller berättelser. På engelska besvarade Qwen3‑1.7B 89,4 % av sådana frågor. På modern kinesiska var andelen 93,0 %, och på klassisk kinesiska steg den till 95,7 %. Forskarna presenterade också en försvarsmetod kallad AXIS, som kombinerar preferensjustering med två nya träningsmål. Bland tre modeller – Qwen3‑1.7B, Qwen3‑4B och GLM‑4‑9B – gav AXIS den bästa kombinationen av säkerhet och användbarhet.

Varför det spelar roll

Om LLM:er används i chattbotar eller assistenter kan berättartrick fortfarande få dem att ge skadliga råd. Därför behövs bättre skydd, som AXIS.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.