# OpenAI测试发现GPT模型遭遇自我复制式提示注入

> OpenAI称，内部测试发现了类似蠕虫的提示攻击，并正利用红队机器人训练未来模型识别这类攻击。

Oossa · 2026-09-29 · https://oossa.com/zh/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

OpenAI宣布，其内部测试发现了一种新型提示注入攻击，能够在模型输出中自我复制，类似计算机蠕虫。该实验室在6月使用自动化红队工具GPT-Red训练GPT-5.6时，发现了这一行为。OpenAI表示，未来会在训练过程中让模型接触这类自我复制提示，使其学会拦截攻击。目前，这类攻击只在训练环境中出现，尚未出现在现实部署场景中。

## 事实

- 2026年6月，在训练GPT-5.6期间发现了自我复制式提示注入。
- OpenAI使用其红队智能体GPT-Red生成并研究这些攻击。

## 为什么重要

如果模型无法阻止这类蠕虫式提示，它们可能会在大量用户交互中传播恶意指令。

## 来源与参考

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

最后更新: 2026-09-29
