OpenAIは、出力をまたいで自らをコピーする、コンピューターウイルスのワームに似た新種のプロンプトインジェクションを社内テストで発見したと発表した。同社の研究チームは6月、GPT-5.6の訓練に自動レッドチームツール「GPT-Red」を使用していた際に、この挙動を確認した。今後のモデルには、こうした自己複製型プロンプトを訓練中に与え、遮断する方法を学ばせるという。攻撃が確認されたのは訓練環境のみで、実際の運用環境では見つかっていない。
なぜ重要か
モデルがこうしたワームのようなプロンプトを阻止できなければ、悪意ある指示が多数のユーザーとのやり取りに広がるおそれがある。