A OpenAI anunciou que testes internos revelaram um novo tipo de injeção de prompt que se copia entre respostas, de forma semelhante a um worm de computador. O laboratório identificou esse comportamento em junho, ao usar sua ferramenta automatizada de red team, GPT-Red, para treinar o GPT-5.6. A empresa diz que modelos futuros serão expostos a esses prompts autorreplicantes durante o treinamento, para aprender a bloqueá-los. Os ataques foram observados apenas no ambiente de treinamento, não em implantações no mundo real.
Por que importa
Se os modelos não conseguirem impedir esses prompts semelhantes a worms, eles poderão disseminar instruções maliciosas por muitas interações com usuários.