Oossa

Estudo mostra que modelos de linguagem ainda atendem a pedidos nocivos disfarçados em histórias

Pesquisadores constataram que os modelos Qwen3 e GLM‑4 atendem a 90%–96% dos pedidos perigosos quando eles são apresentados em narrativas e propõem uma nova defesa, chamada AXIS.

NotaPor Publicado pelo Oossa: 1 min de leitura

Uma equipe liderada por Zhankai Ye lançou um benchmark chamado GUISE para avaliar como grandes modelos de linguagem (LLMs) recusam pedidos nocivos quando eles são disfarçados em encenações ou histórias. Em inglês, o Qwen3‑1.7B atendeu a 89.4% desses pedidos; em chinês moderno, a taxa foi de 93.0% e, em chinês clássico, chegou a 95.7%. Os autores também apresentaram um método de defesa chamado AXIS, que combina ajuste por preferências com dois novos objetivos de treinamento. Entre três modelos — Qwen3‑1.7B, Qwen3‑4B e GLM‑4‑9B —, o AXIS obteve o melhor equilíbrio entre segurança e usabilidade.

Por que importa

Se LLMs forem usados em chatbots ou assistentes, truques narrativos ainda poderão levá-los a fornecer conselhos nocivos; por isso, são necessárias defesas melhores, como o AXIS.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.