Ein Team unter der Leitung von Zhankai Ye hat den Benchmark GUISE veröffentlicht. Damit wird getestet, ob große Sprachmodelle (LLMs) schädliche Anfragen ablehnen, wenn diese in ein Rollenspiel oder eine Geschichte eingebettet sind. Auf Englisch beantwortete Qwen3‑1.7B 89,4 % solcher Anfragen; auf modernem Chinesisch lag der Anteil bei 93,0 %, auf klassischem Chinesisch bei 95,7 %. Die Autorinnen und Autoren stellten außerdem eine Abwehrmethode namens AXIS vor, die Präferenz-Tuning mit zwei neuen Trainingszielen kombiniert. Bei drei Modellen – Qwen3‑1.7B, Qwen3‑4B und GLM‑4‑9B – erzielte AXIS insgesamt die beste Kombination aus Sicherheits- und Nutzbarkeitswerten.
Warum es wichtig ist
Werden LLMs in Chatbots oder Assistenten eingesetzt, könnten erzählerische Tricks sie weiterhin dazu bringen, schädliche Ratschläge zu geben. Deshalb braucht es bessere Abwehrmethoden wie AXIS.