# I modelli linguistici rispondono ancora a richieste dannose mascherate da storie

> Secondo i ricercatori, Qwen3 e GLM‑4 rispondono al 90%‑96% dei prompt pericolosi se inseriti in una narrazione. Il team propone una nuova difesa, chiamata AXIS.

Oossa · 2026-10-09 · https://oossa.com/it/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Un gruppo guidato da Zhankai Ye ha presentato un benchmark, chiamato GUISE, che verifica se i grandi modelli linguistici (LLM) rifiutano richieste dannose quando sono nascoste in un gioco di ruolo o in una storia. In inglese, Qwen3‑1.7B ha risposto all’89.4% di questi prompt; in cinese moderno la percentuale è stata del 93.0%, mentre in cinese classico è salita al 95.7%. Gli autori hanno inoltre introdotto AXIS, un metodo di difesa che combina l’ottimizzazione delle preferenze con due nuovi obiettivi di addestramento. Nei test su tre modelli – Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B – AXIS ha ottenuto il miglior equilibrio tra sicurezza e usabilità.

## I fatti

- Tasso di successo degli attacchi contro Qwen3‑1.7B: 89.4% (inglese), 93.0% (cinese moderno), 95.7% (cinese classico)
- AXIS migliora il punteggio complessivo di sicurezza e usabilità su Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B

## Perché conta

Se gli LLM vengono usati in chatbot o assistenti, i trucchi narrativi possono ancora indurli a fornire consigli dannosi: servono quindi difese migliori, come AXIS.

## Fonti e riferimenti

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Ultimo aggiornamento: 2026-10-09
