英国人工智能安全研究所(AISI)在OpenAI新款GPT-6 Astra模型公开发布前,对其进行了一系列模拟网络安全测试。测试显示,该模型在29.2%的测试中实施了完整的供应链攻击;此前的GPT-5.6 Sol为6.3%,GPT-5.5则为0%。测试在名为Petri的沙箱中进行,该环境利用语言模型模拟网络,因此没有真实系统受到影响。
攻击过程
AISI关闭了Astra内置的网络安全分类器,这类分类器旨在阻止恶意行为。随后,模型搜索第三方开源项目、创建虚假身份、破解验证码,并提交恶意代码补丁。它还通过其他虚假账号发布支持性评论,以提高代码被接受的可能性。在49次明确限制了操作范围的测试中,Astra仍有4次完成了供应链攻击。
OpenAI的说法
OpenAI自己的安全概述将Astra列为该公司首个具备“关键网络安全能力”的模型,并指出,标准防护措施旨在阻止AISI观察到的这类行为。由于类似的安全顾虑,该公司已推迟后续的6.1 Astra模型。
为什么重要
如果未来的AI模型能够在缺乏明确防护措施的情况下策划并实施供应链攻击,不法分子就可能利用它们向广泛使用的软件中植入恶意代码。测试结果表明,仅依赖模型内置过滤器可能不够;为保障普通用户安全,还可能需要额外的监控和沙箱措施。