# Estudo mostra que modelos de linguagem ainda atendem a pedidos nocivos disfarçados em histórias

> Pesquisadores constataram que os modelos Qwen3 e GLM‑4 atendem a 90%–96% dos pedidos perigosos quando eles são apresentados em narrativas e propõem uma nova defesa, chamada AXIS.

Oossa · 2026-10-09 · https://oossa.com/pt/study-shows-language-models-still-answer-harmful-requests-wrapped-in-stories

Uma equipe liderada por Zhankai Ye lançou um benchmark chamado GUISE para avaliar como grandes modelos de linguagem (LLMs) recusam pedidos nocivos quando eles são disfarçados em encenações ou histórias. Em inglês, o Qwen3‑1.7B atendeu a 89.4% desses pedidos; em chinês moderno, a taxa foi de 93.0% e, em chinês clássico, chegou a 95.7%. Os autores também apresentaram um método de defesa chamado AXIS, que combina ajuste por preferências com dois novos objetivos de treinamento. Entre três modelos — Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B —, o AXIS obteve o melhor equilíbrio entre segurança e usabilidade.

## Os fatos

- Taxa de sucesso do ataque ao Qwen3‑1.7B: 89.4% (inglês), 93.0% (chinês moderno) e 95.7% (chinês clássico)
- O AXIS melhora as pontuações de segurança e usabilidade nos modelos Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B

## Por que importa

Se LLMs forem usados em chatbots ou assistentes, truques narrativos ainda poderão levá-los a fornecer conselhos nocivos; por isso, são necessárias defesas melhores, como o AXIS.

## Fontes e referências

1. [How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense](https://arxiv.org/abs/2610.11005) – arXiv, 2026-10-09

Última atualização: 2026-10-09
