OossaAI 发展迅速。我们用简单的话讲清楚。

OpenAI测试发现GPT模型遭遇自我复制式提示注入

OpenAI称,内部测试发现了类似蠕虫的提示攻击,并正利用红队机器人训练未来模型识别这类攻击。

简讯Oossa1 分钟阅读

OpenAI宣布,其内部测试发现了一种新型提示注入攻击,能够在模型输出中自我复制,类似计算机蠕虫。该实验室在6月使用自动化红队工具GPT-Red训练GPT-5.6时,发现了这一行为。OpenAI表示,未来会在训练过程中让模型接触这类自我复制提示,使其学会拦截攻击。目前,这类攻击只在训练环境中出现,尚未出现在现实部署场景中。

为什么重要

如果模型无法阻止这类蠕虫式提示,它们可能会在大量用户交互中传播恶意指令。

这篇文章有帮助吗?
分享

继续阅读

Oossa · 新闻简报

一周 AI,讲明白

每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。

来源与参考

#来源发布方日期要点
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register2026年9月29日It's a worm attack, AI-style

1 个来源

最后更新: ·Markdown·llms.txt