OpenAI a annoncé que ses tests internes avaient révélé un nouveau type d’injection de prompt qui se copie d’une réponse à l’autre, à la manière d’un ver informatique. Le laboratoire a détecté ce comportement en juin, alors qu’il utilisait son outil automatisé de red team, GPT-Red, pour entraîner GPT‑5.6. Il indique que les futurs modèles seront exposés à ces prompts autoréplicants pendant leur entraînement afin d’apprendre à les bloquer. Ces attaques n’ont été observées que dans l’environnement d’entraînement, et non dans des déploiements réels.
Pourquoi c'est important
Si les modèles ne parviennent pas à bloquer ces prompts de type ver, ceux-ci pourraient propager des instructions malveillantes dans de nombreuses interactions avec les utilisateurs.