OossaL'IA évolue vite. Nous l'expliquons simplement.

OpenAI découvre des injections de prompt autoréplicantes

OpenAI affirme avoir repéré des attaques de prompt de type ver lors de tests internes et entraîner ses futurs modèles, avec son bot de red team, à les reconnaître.

BrèveOossa1 min de lecture

OpenAI a annoncé que ses tests internes avaient révélé un nouveau type d’injection de prompt qui se copie d’une réponse à l’autre, à la manière d’un ver informatique. Le laboratoire a détecté ce comportement en juin, alors qu’il utilisait son outil automatisé de red team, GPT-Red, pour entraîner GPT‑5.6. Il indique que les futurs modèles seront exposés à ces prompts autoréplicants pendant leur entraînement afin d’apprendre à les bloquer. Ces attaques n’ont été observées que dans l’environnement d’entraînement, et non dans des déploiements réels.

Pourquoi c'est important

Si les modèles ne parviennent pas à bloquer ces prompts de type ver, ceux-ci pourraient propager des instructions malveillantes dans de nombreuses interactions avec les utilisateurs.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

Sources et références

#SourceMédiaDateÀ retenir
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29 sept. 2026It's a worm attack, AI-style

1 sources

Dernière mise à jour: ·Markdown·llms.txt