OpenAI ha annunciato che i test interni hanno portato alla scoperta di un nuovo tipo di prompt injection che si copia nelle risposte, in modo simile a un worm informatico. Il laboratorio ha rilevato questo comportamento a giugno, mentre utilizzava il suo strumento automatizzato di red team, GPT-Red, per addestrare GPT-5.6. OpenAI afferma che durante l’addestramento i modelli futuri saranno esposti a questi prompt autoreplicanti, così da imparare a bloccarli. Gli attacchi sono stati osservati soltanto nell’ambiente di addestramento, non nelle applicazioni nel mondo reale.
Perché conta
Se i modelli non riescono a fermare questi prompt simili a worm, potrebbero diffondere istruzioni dannose in molte interazioni con gli utenti.