Un equipo dirigido por Zhankai Ye publicó un banco de pruebas llamado GUISE, que evalúa si los modelos de lenguaje grandes (LLM) rechazan solicitudes dañinas cuando estas se ocultan en un juego de rol o una historia. En inglés, Qwen3‑1.7B respondió al 89.4% de esas indicaciones; en chino moderno, la tasa fue del 93.0%, y en chino clásico subió al 95.7%. Los autores también presentaron un método de defensa llamado AXIS, que combina el ajuste de preferencias con dos nuevos objetivos de entrenamiento. En tres modelos —Qwen3‑1.7B, Qwen3‑4B y GLM‑4‑9B—, AXIS logró la mejor combinación de puntuaciones de seguridad y facilidad de uso.
Por qué importa
Si los LLM se usan en chatbots o asistentes, los trucos narrativos aún podrían hacer que den consejos dañinos, por lo que hacen falta mejores defensas como AXIS.