OossaL'IA evolve in fretta. Noi la spieghiamo in modo semplice.

OpenAI rileva prompt injection autoreplicanti nei suoi GPT

OpenAI afferma di aver individuato attacchi prompt simili a worm nei test interni e di addestrare i modelli futuri a riconoscerli con il suo bot red team.

BreveOossa1 min di lettura

OpenAI ha annunciato che i test interni hanno portato alla scoperta di un nuovo tipo di prompt injection che si copia nelle risposte, in modo simile a un worm informatico. Il laboratorio ha rilevato questo comportamento a giugno, mentre utilizzava il suo strumento automatizzato di red team, GPT-Red, per addestrare GPT-5.6. OpenAI afferma che durante l’addestramento i modelli futuri saranno esposti a questi prompt autoreplicanti, così da imparare a bloccarli. Gli attacchi sono stati osservati soltanto nell’ambiente di addestramento, non nelle applicazioni nel mondo reale.

Perché conta

Se i modelli non riescono a fermare questi prompt simili a worm, potrebbero diffondere istruzioni dannose in molte interazioni con gli utenti.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.

Fonti e riferimenti

#FonteTestataDataPunto chiave
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29 set 2026It's a worm attack, AI-style

1 fonti

Ultimo aggiornamento: ·Markdown·llms.txt