# OpenAI découvre des injections de prompt autoréplicantes

> OpenAI affirme avoir repéré des attaques de prompt de type ver lors de tests internes et entraîner ses futurs modèles, avec son bot de red team, à les reconnaître.

Oossa · 2026-09-29 · https://oossa.com/fr/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

OpenAI a annoncé que ses tests internes avaient révélé un nouveau type d’injection de prompt qui se copie d’une réponse à l’autre, à la manière d’un ver informatique. Le laboratoire a détecté ce comportement en juin, alors qu’il utilisait son outil automatisé de red team, GPT-Red, pour entraîner GPT‑5.6. Il indique que les futurs modèles seront exposés à ces prompts autoréplicants pendant leur entraînement afin d’apprendre à les bloquer. Ces attaques n’ont été observées que dans l’environnement d’entraînement, et non dans des déploiements réels.

## Les faits

- Des injections de prompt autoréplicantes ont été découvertes en juin 2026, pendant l’entraînement de GPT‑5.6.
- OpenAI a utilisé son agent de red team GPT-Red pour générer et étudier les attaques.

## Pourquoi c'est important

Si les modèles ne parviennent pas à bloquer ces prompts de type ver, ceux-ci pourraient propager des instructions malveillantes dans de nombreuses interactions avec les utilisateurs.

## Sources et références

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

Dernière mise à jour: 2026-09-29
