Oossa

Un estudio revela que los modelos aún responden a pedidos dañinos disfrazados de historias

Investigadores comprobaron que los modelos Qwen3 y GLM‑4 responden al 90%‑96% de las indicaciones peligrosas cuando se presentan dentro de una narración, y proponen una nueva defensa llamada AXIS.

BrevePor Publicado por Oossa: 1 min de lectura

Un equipo dirigido por Zhankai Ye publicó un banco de pruebas llamado GUISE, que evalúa si los modelos de lenguaje grandes (LLM) rechazan solicitudes dañinas cuando estas se ocultan en un juego de rol o una historia. En inglés, Qwen3‑1.7B respondió al 89.4% de esas indicaciones; en chino moderno, la tasa fue del 93.0%, y en chino clásico subió al 95.7%. Los autores también presentaron un método de defensa llamado AXIS, que combina el ajuste de preferencias con dos nuevos objetivos de entrenamiento. En tres modelos —Qwen3‑1.7B, Qwen3‑4B y GLM‑4‑9B—, AXIS logró la mejor combinación de puntuaciones de seguridad y facilidad de uso.

Por qué importa

Si los LLM se usan en chatbots o asistentes, los trucos narrativos aún podrían hacer que den consejos dañinos, por lo que hacen falta mejores defensas como AXIS.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.