· 1 分で読める
AIの脱獄攻撃、試行回数に応じた成功率を予測する新モデル
Marco Biroli氏らの研究チームは2026年9月29日、攻撃者がプロンプトを増やすにつれて脱獄の試みがどれほど成功しやすくなるかを推定する簡潔な数式を発表した。
Oossa · Oossaについて
コンピューター科学者のMarco Biroli氏は2026年9月29日、「Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking」と題する論文をarXivに投稿した。この研究では、攻撃者が2つの変数、すなわちプロンプトのバリエーション数(N)と各バリエーションに対する応答数(M)を増やしたとき、脱獄攻撃の成功率がどう変わるかを説明する、シンプルな「障壁モデル」を提案している。安全機構に関係する4つの数値だけを使い、これまで検証されたものよりはるかに大規模な攻撃の結果を予測できる。
新しいモデルで何が分かるのか?
このモデルでは、各プロンプトに基本的な安全性の水準があり、そこにランダムな「障壁」が加わると捉える。攻撃者が十分な数のバリエーションを試すと、その障壁を乗り越えられる。5種類の言語モデルのデータに4つの数値を当てはめたところ、いずれも同じスケーリング曲線に沿うことが示された。これにより、プロンプトのバリエーションが最大100件の実験から、1万件のケースまで外挿できる。従来の研究では、こうした予測を信頼性高く行うのは難しかった。
論文では、AIの出力のランダム性を調整する設定値である生成温度が、攻撃の成功率にどう影響するかも検討している。同じ4つの数値を使うことで、著者らは実験していない温度での成功率も予測できる。
AIの安全性にとっての意味
モデルの予測が実証されれば、安全性エンジニアは脱獄が起きやすくなるまでに攻撃者が何種類のプロンプトを試す必要があるかを推定できる。これは、公開APIで許容するプロンプトの量に現実的な上限を設けたり、不審なパターンをどの程度厳しく監視したりするかを決めるうえで役立つ。
また、この研究は、攻撃の成功率がNに対して単純なべき乗則に従うという従来の主張にも異議を唱えている。温度に応じて変化する、より複雑な曲線を示したことで、防御策を考える際には試行回数だけでなく、複数の要因を考慮する必要があると示唆している。
なぜ重要か
このモデルを使えば、AI開発者は安全策を攻撃者が突破する難しさを手早く見積もり、APIの利用制限や監視ツールの設計に役立てられる。また、試行回数のような単一の指標だけに頼ると、脱獄を容易にするほかの要因を見落とすおそれがあることも示している。
出典と参考資料
| # | 出典 | 媒体 | 日付 | 要点 |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 2026/09/29 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 件の出典
最終更新:
Oossa · ニュースレター
今週のAIを、わかりやすく
毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。