Oossa

I modelli linguistici rispondono ancora a richieste dannose mascherate da storie

Secondo i ricercatori, Qwen3 e GLM‑4 rispondono al 90%‑96% dei prompt pericolosi se inseriti in una narrazione. Il team propone una nuova difesa, chiamata AXIS.

BreveDi Pubblicato da Oossa: 1 min di lettura

Un gruppo guidato da Zhankai Ye ha presentato un benchmark, chiamato GUISE, che verifica se i grandi modelli linguistici (LLM) rifiutano richieste dannose quando sono nascoste in un gioco di ruolo o in una storia. In inglese, Qwen3‑1.7B ha risposto all’89.4% di questi prompt; in cinese moderno la percentuale è stata del 93.0%, mentre in cinese classico è salita al 95.7%. Gli autori hanno inoltre introdotto AXIS, un metodo di difesa che combina l’ottimizzazione delle preferenze con due nuovi obiettivi di addestramento. Nei test su tre modelli – Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B – AXIS ha ottenuto il miglior equilibrio tra sicurezza e usabilità.

Perché conta

Se gli LLM vengono usati in chatbot o assistenti, i trucchi narrativi possono ancora indurli a fornire consigli dannosi: servono quindi difese migliori, come AXIS.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.