Oossa

Les modèles de langage répondent encore aux demandes dangereuses déguisées en récits

Selon des chercheurs, Qwen3 et GLM‑4 répondent à 90 % à 96 % des requêtes dangereuses lorsqu’elles sont intégrées à un récit. Ils proposent une nouvelle défense, baptisée AXIS.

BrèvePar Publié par Oossa: 1 min de lecture

Une équipe dirigée par Zhankai Ye a publié un banc d’essai appelé GUISE, qui évalue la capacité des grands modèles de langage (LLM) à refuser des demandes dangereuses dissimulées dans un jeu de rôle ou un récit. En anglais, Qwen3‑1.7B a répondu à 89,4 % de ces requêtes ; le taux atteignait 93,0 % en chinois moderne et 95,7 % en chinois classique. Les auteurs ont également présenté une méthode de défense nommée AXIS, qui associe un ajustement par préférences à deux nouveaux objectifs d’entraînement. Sur trois modèles — Qwen3‑1.7B, Qwen3‑4B et GLM‑4‑9B — AXIS a obtenu le meilleur équilibre entre sécurité et facilité d’utilisation.

Pourquoi c'est important

Si les LLM sont utilisés dans des chatbots ou des assistants, des astuces narratives peuvent encore les pousser à fournir des conseils dangereux. Des défenses plus efficaces, comme AXIS, sont donc nécessaires.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.