· 1 分钟阅读
新模型预测 AI 越狱攻击成功率如何随攻击投入增加
由 Marco Biroli 领衔的研究团队于 2026 年 9 月 29 日发布了一篇论文,提出一个简单公式,用于估算攻击者尝试更多提示词后,越狱攻击的成功频率会如何变化。
Oossa · 关于 Oossa
2026 年 9 月 29 日,计算机科学家 Marco Biroli 在 arXiv 上发布了一篇题为《逃离对齐:最佳 N 次越狱的物理陷阱模型》的论文。该研究提出了一种简单明了的“屏障模型”,用于解释攻击者增加两个变量时,越狱攻击成功率会如何变化:提示词变体数量(N)和每种变体对应的回复数量(M)。该模型只使用与安全机制相关的四个数值,却能预测远超目前测试规模的攻击结果。
新模型能做什么?
模型为每条提示词设定一个基础安全水平,再加入一道随机“屏障”;攻击者尝试足够多的变体后,就可能突破这道屏障。作者将这四个数值拟合到五种不同语言模型的数据后发现,五种模型都落在同一条缩放曲线上。这意味着,他们可以根据最多测试 100 种提示词变体的实验结果,推算出使用 10,000 种变体时的情况,而此前的研究无法可靠地做到这一点。
论文还考察了生成温度——一个用于控制 AI 输出随机性的参数——对攻击成功率的影响。利用同样的四个数值,作者可以预测在从未测试过的温度下,攻击的成功率会是多少。
这对 AI 安全为何重要
如果模型的预测经得住检验,安全工程师就能估算攻击者需要尝试多少种提示词变体,越狱才可能得手。这有助于他们为公共 API 设定合理的提示词使用上限,或更积极地监测可疑模式。
这项研究也对早前有关攻击成功率与 N 呈简单幂律关系的说法提出质疑。研究显示,成功率曲线更复杂且受温度影响,说明防御措施需要考虑多个因素,而不能只看尝试次数。
为什么重要
该模型为 AI 开发者提供了一种快速评估攻击者突破安全防护难度的方法,可用于制定 API 限制和监测工具。它也提醒人们,只依赖尝试次数这一项指标,可能会忽略让越狱攻击更容易的其他因素。
来源与参考
| # | 来源 | 发布方 | 日期 | 要点 |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 2026年9月29日 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 个来源
最后更新:
Oossa · 新闻简报
一周 AI,讲明白
每周一,用通俗的语言讲清值得知道的新闻。免费,无垃圾邮件。