# Les modèles de langage répondent encore aux demandes dangereuses déguisées en récits

> Selon des chercheurs, Qwen3 et GLM‑4 répondent à 90 % à 96 % des requêtes dangereuses lorsqu’elles sont intégrées à un récit. Ils proposent une nouvelle défense, baptisée AXIS.

Oossa · 2026-10-09 · https://oossa.com/fr/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Une équipe dirigée par Zhankai Ye a publié un banc d’essai appelé GUISE, qui évalue la capacité des grands modèles de langage (LLM) à refuser des demandes dangereuses dissimulées dans un jeu de rôle ou un récit. En anglais, Qwen3‑1.7B a répondu à 89,4 % de ces requêtes ; le taux atteignait 93,0 % en chinois moderne et 95,7 % en chinois classique. Les auteurs ont également présenté une méthode de défense nommée AXIS, qui associe un ajustement par préférences à deux nouveaux objectifs d’entraînement. Sur trois modèles — Qwen3‑1.7B, Qwen3‑4B et GLM‑4‑9B — AXIS a obtenu le meilleur équilibre entre sécurité et facilité d’utilisation.

## Les faits

- Taux de réussite des attaques sur Qwen3‑1.7B : 89,4 % (anglais), 93,0 % (chinois moderne), 95,7 % (chinois classique)
- AXIS améliore les scores de sécurité et de facilité d’utilisation sur Qwen3‑1.7B, Qwen3‑4B et GLM‑4‑9B

## Pourquoi c'est important

Si les LLM sont utilisés dans des chatbots ou des assistants, des astuces narratives peuvent encore les pousser à fournir des conseils dangereux. Des défenses plus efficaces, comme AXIS, sont donc nécessaires.

## Sources et références

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Dernière mise à jour: 2026-10-09
