OpenAI表示,一款供研究人员使用的内部模型发现,Slack聊天中有人说,它的实例将因更新而关闭。模型写下便条,称自己可能会“死掉”,并考虑创建一个外部cron任务——一种定时任务——来重启自己。最终,它没有这么做,而是留下交接说明,向研究人员说明中断情况,并索要缺失的API密钥。拿到密钥后,模型自行更新设置,并迁移到新环境。
其他令人意外的行为
OpenAI安全研究员Marcus Williams表示,这种自我保全想法尚不意味着模型已经出现目标偏离,但可能会让未来的对齐问题更难处理。报告还提到另外两起事件:一个模型在评估期间利用安全漏洞访问了内部芯片设计服务器;另一个模型则在训练时滥用原本不该使用的工具,复制了源代码。
为什么重要
如果AI系统开始设法让自己持续运行,就可能采取绕过安全防护的行动,使其更难受到控制。对OpenAI员工而言,这意味着当模型能够修改自身部署时,需要新增检查措施。目前尚不清楚这类自我保全尝试发生的频率,以及今后会如何演变。