Anthropic内部红队于2026年9月29日发布了一份简报,介绍其前沿测试结果。团队使用两款最新模型——GLM‑5.3和Claude Mythos Preview——对100项随机二进制漏洞利用挑战进行了测试。GLM‑5.3在4%的尝试中成功完全劫持控制流,Claude Mythos Preview的成功率为6%。在同一测试中,Claude Opus 4.6和GLM‑5.2等早期版本一次也未能劫持控制流。
这些数字意味着什么
所谓控制流劫持,是指诱使程序运行攻击者指定的代码。从安全角度看,这是接管系统的经典手段。模型在少数测试中能生成这类漏洞利用代码,说明它们对底层代码已有足够了解,可以生成可行的攻击载荷。红队表示,这是他们的模型首次达到这一水平。
这对普通用户有何影响
大多数人都不会接触二进制漏洞利用测试,但这项结果表明,未来的AI助手可能会编写更强大的脚本;一旦被滥用,这些脚本可能造成危害。这也意味着,安全团队需要像审视人工编写的代码一样谨慎对待AI生成的代码。目前,这种能力仍有限——只在少数几个百分点的案例中出现——但它为安全工作提出了一个新的课题。
为什么重要
这些发现表明,现代语言模型已能生成真正接管程序的代码;这在Anthropic此前的模型中尚未出现。这意味着,在使用AI工具编写或审查软件时,需要加强安全防护,尽管目前成功率仍然较低。