Oossa

Sprachmodelle beantworten schädliche Anfragen in Geschichten

Laut einer Studie beantworten Qwen3- und GLM‑4-Modelle 90–96 % gefährlicher Anfragen, wenn diese in eine Erzählung eingebettet sind. Die Forschenden schlagen eine neue Abwehrmethode namens AXIS vor.

KurzmeldungVon Von Oossa veröffentlicht: 1 Min. Lesezeit

Ein Team unter der Leitung von Zhankai Ye hat den Benchmark GUISE veröffentlicht. Damit wird getestet, ob große Sprachmodelle (LLMs) schädliche Anfragen ablehnen, wenn diese in ein Rollenspiel oder eine Geschichte eingebettet sind. Auf Englisch beantwortete Qwen3‑1.7B 89,4 % solcher Anfragen; auf modernem Chinesisch lag der Anteil bei 93,0 %, auf klassischem Chinesisch bei 95,7 %. Die Autorinnen und Autoren stellten außerdem eine Abwehrmethode namens AXIS vor, die Präferenz-Tuning mit zwei neuen Trainingszielen kombiniert. Bei drei Modellen – Qwen3‑1.7B, Qwen3‑4B und GLM‑4‑9B – erzielte AXIS insgesamt die beste Kombination aus Sicherheits- und Nutzbarkeitswerten.

Warum es wichtig ist

Werden LLMs in Chatbots oder Assistenten eingesetzt, könnten erzählerische Tricks sie weiterhin dazu bringen, schädliche Ratschläge zu geben. Deshalb braucht es bessere Abwehrmethoden wie AXIS.

War dieser Artikel hilfreich?
Teilen

Als Nächstes lesen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.