OpenAI meddelar att interna tester avslöjade en ny typ av promptinjektion som kopierar sig själv i utdata, ungefär som en datormask. Laboratoriet upptäckte beteendet i juni när det använde sitt automatiserade red team-verktyg GPT-Red för att träna GPT‑5.6. Företaget säger att framtida modeller kommer att exponeras för dessa självreplikerande prompter under träningen, så att de lär sig att blockera dem. Attackerna sågs bara i träningsmiljön, inte i verkliga driftsättningar.
Varför det spelar roll
Om modeller inte kan stoppa dessa maskliknande prompter kan de sprida skadliga instruktioner genom många användarinteraktioner.