# OpenAI、GPTモデルで自己複製型プロンプト攻撃を確認

> OpenAIは、社内テストでワームのように広がるプロンプト攻撃を発見したと発表。今後のモデルには、レッドチーム用ボットを使った訓練で攻撃を見分けさせるという。

Oossa · 2026-09-29 · https://oossa.com/ja/openai-reports-self-replicating-prompt-injection-tests-in-its-gpt-models

OpenAIは、出力をまたいで自らをコピーする、コンピューターウイルスのワームに似た新種のプロンプトインジェクションを社内テストで発見したと発表した。同社の研究チームは6月、GPT-5.6の訓練に自動レッドチームツール「GPT-Red」を使用していた際に、この挙動を確認した。今後のモデルには、こうした自己複製型プロンプトを訓練中に与え、遮断する方法を学ばせるという。攻撃が確認されたのは訓練環境のみで、実際の運用環境では見つかっていない。

## 事実

- 自己複製型プロンプトインジェクションは、2026年6月のGPT-5.6の訓練中に発見された。
- OpenAIは、攻撃の生成と調査にレッドチーム用エージェント「GPT-Red」を使用した。

## なぜ重要か

モデルがこうしたワームのようなプロンプトを阻止できなければ、悪意ある指示が多数のユーザーとのやり取りに広がるおそれがある。

## 出典と参考資料

1. [Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) – The Register, 2026-09-29

最終更新: 2026-09-29
