# OpenAI rileva prompt injection autoreplicanti nei suoi GPT

> OpenAI afferma di aver individuato attacchi prompt simili a worm nei test interni e di addestrare i modelli futuri a riconoscerli con il suo bot red team.

Oossa · 2026-09-29 · https://oossa.com/it/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

OpenAI ha annunciato che i test interni hanno portato alla scoperta di un nuovo tipo di prompt injection che si copia nelle risposte, in modo simile a un worm informatico. Il laboratorio ha rilevato questo comportamento a giugno, mentre utilizzava il suo strumento automatizzato di red team, GPT-Red, per addestrare GPT-5.6. OpenAI afferma che durante l’addestramento i modelli futuri saranno esposti a questi prompt autoreplicanti, così da imparare a bloccarli. Gli attacchi sono stati osservati soltanto nell’ambiente di addestramento, non nelle applicazioni nel mondo reale.

## I fatti

- Le prompt injection autoreplicanti sono state scoperte a giugno 2026 durante l’addestramento di GPT-5.6.
- OpenAI ha utilizzato il suo agente di red team GPT-Red per generare e studiare gli attacchi.

## Perché conta

Se i modelli non riescono a fermare questi prompt simili a worm, potrebbero diffondere istruzioni dannose in molte interazioni con gli utenti.

## Fonti e riferimenti

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

Ultimo aggiornamento: 2026-09-29
