# OpenAI detecta ataques de prompt que se autorreplican

> A empresa afirma ter encontrado ataques de prompt semelhantes a worms em testes internos e está treinando modelos futuros com seu bot de red team para reconhecê-los.

Oossa · 2026-09-29 · https://oossa.com/pt/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

A OpenAI anunciou que testes internos revelaram um novo tipo de injeção de prompt que se copia entre respostas, de forma semelhante a um worm de computador. O laboratório identificou esse comportamento em junho, ao usar sua ferramenta automatizada de red team, GPT-Red, para treinar o GPT-5.6. A empresa diz que modelos futuros serão expostos a esses prompts autorreplicantes durante o treinamento, para aprender a bloqueá-los. Os ataques foram observados apenas no ambiente de treinamento, não em implantações no mundo real.

## Os fatos

- Injeções de prompt autorreplicantes foram descobertas em junho de 2026, durante o treinamento do GPT-5.6.
- A OpenAI usou seu agente de red team GPT-Red para gerar e estudar os ataques.

## Por que importa

Se os modelos não conseguirem impedir esses prompts semelhantes a worms, eles poderão disseminar instruções maliciosas por muitas interações com usuários.

## Fontes e referências

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

Última atualização: 2026-09-29
