OpenAI maakte bekend dat interne tests een nieuw soort promptinjectie aan het licht hebben gebracht, die zichzelf in uitvoer kopieert, vergelijkbaar met een computerworm. Het lab ontdekte dit gedrag in juni, toen het zijn geautomatiseerde red-teamtool GPT-Red inzette om GPT-5.6 te trainen. Het zegt toekomstige modellen tijdens de training met deze zelfkopiërende prompts in aanraking te brengen, zodat ze leren die tegen te houden. De aanvallen zijn alleen in de trainingsomgeving waargenomen, niet in toepassingen in de praktijk.
Waarom het ertoe doet
Als modellen deze wormachtige prompts niet kunnen tegenhouden, kunnen ze schadelijke instructies verspreiden in een groot aantal gebruikersinteracties.