# 新模型预测 AI 越狱攻击成功率如何随攻击投入增加

> 由 Marco Biroli 领衔的研究团队于 2026 年 9 月 29 日发布了一篇论文，提出一个简单公式，用于估算攻击者尝试更多提示词后，越狱攻击的成功频率会如何变化。

Oossa · 2026-09-29 · https://oossa.com/zh/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

2026 年 9 月 29 日，计算机科学家 Marco Biroli 在 arXiv 上发布了一篇题为《逃离对齐：最佳 N 次越狱的物理陷阱模型》的论文。该研究提出了一种简单明了的“屏障模型”，用于解释攻击者增加两个变量时，越狱攻击成功率会如何变化：提示词变体数量（N）和每种变体对应的回复数量（M）。该模型只使用与安全机制相关的四个数值，却能预测远超目前测试规模的攻击结果。

## 新模型能做什么？

模型为每条提示词设定一个基础安全水平，再加入一道随机“屏障”；攻击者尝试足够多的变体后，就可能突破这道屏障。作者将这四个数值拟合到五种不同语言模型的数据后发现，五种模型都落在同一条缩放曲线上。这意味着，他们可以根据最多测试 100 种提示词变体的实验结果，推算出使用 10,000 种变体时的情况，而此前的研究无法可靠地做到这一点。

论文还考察了生成温度——一个用于控制 AI 输出随机性的参数——对攻击成功率的影响。利用同样的四个数值，作者可以预测在从未测试过的温度下，攻击的成功率会是多少。

## 这对 AI 安全为何重要

如果模型的预测经得住检验，安全工程师就能估算攻击者需要尝试多少种提示词变体，越狱才可能得手。这有助于他们为公共 API 设定合理的提示词使用上限，或更积极地监测可疑模式。

这项研究也对早前有关攻击成功率与 N 呈简单幂律关系的说法提出质疑。研究显示，成功率曲线更复杂且受温度影响，说明防御措施需要考虑多个因素，而不能只看尝试次数。

## 事实

- 该论文于 2026 年 9 月 29 日发布在 arXiv 上。
- Marco Biroli 被列为该研究的唯一作者。
- 该模型仅用四个与安全相关的参数，就拟合了五种不同语言模型的数据。
- 该模型可以根据 N ≤ 100 的数据，推算提示词变体数量为 N = 10⁴ 时的攻击成功率。
- 作者发现，成功率指数会随 N 变化，这与简单幂律假设相矛盾。

## 为什么重要

该模型为 AI 开发者提供了一种快速评估攻击者突破安全防护难度的方法，可用于制定 API 限制和监测工具。它也提醒人们，只依赖尝试次数这一项指标，可能会忽略让越狱攻击更容易的其他因素。

## 来源与参考

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

最后更新: 2026-09-29
