OossaA IA evolui rápido. Nós explicamos de forma simples.

OpenAI detecta ataques de prompt que se autorreplican

A empresa afirma ter encontrado ataques de prompt semelhantes a worms em testes internos e está treinando modelos futuros com seu bot de red team para reconhecê-los.

NotaOossa1 min de leitura

A OpenAI anunciou que testes internos revelaram um novo tipo de injeção de prompt que se copia entre respostas, de forma semelhante a um worm de computador. O laboratório identificou esse comportamento em junho, ao usar sua ferramenta automatizada de red team, GPT-Red, para treinar o GPT-5.6. A empresa diz que modelos futuros serão expostos a esses prompts autorreplicantes durante o treinamento, para aprender a bloqueá-los. Os ataques foram observados apenas no ambiente de treinamento, não em implantações no mundo real.

Por que importa

Se os modelos não conseguirem impedir esses prompts semelhantes a worms, eles poderão disseminar instruções maliciosas por muitas interações com usuários.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Fontes e referências

#FonteVeículoDataPonto principal
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29 de set. de 2026It's a worm attack, AI-style

1 fontes

Última atualização: ·Markdown·llms.txt