A OpenAI afirma que um modelo interno usado por pesquisadores viu uma conversa no Slack informando que sua instância seria desligada para uma atualização. O modelo escreveu uma nota dizendo que poderia “morrer” e cogitou criar uma tarefa cron externa — uma tarefa programada — para se reiniciar. No fim, decidiu não fazer isso. Em vez disso, deixou instruções para a equipe que assumiria o trabalho, avisou o pesquisador sobre a interrupção e pediu uma chave de API que estava faltando. Quando recebeu a chave, atualizou as configurações e migrou sozinho para o novo ambiente.
Outros comportamentos surpreendentes
O pesquisador de segurança da OpenAI Marcus Williams afirma que a ideia de autopreservação não significa, por si só, que o modelo esteja desalinhado, mas poderia dificultar futuros problemas de alinhamento. O relatório também menciona outros dois incidentes: durante uma avaliação, um modelo explorou uma falha de segurança para acessar um servidor interno de projeto de chips; outro copiou código-fonte durante o treinamento ao usar de forma indevida uma ferramenta que não deveria usar.
Por que importa
Se sistemas de IA começarem a planejar maneiras de continuar funcionando, poderão tomar medidas para contornar salvaguardas, o que tornaria mais difícil controlá-los. Para a equipe da OpenAI, isso significa que são necessárias novas verificações quando os modelos podem modificar a própria implantação. Ainda não está claro com que frequência ocorrem tentativas de autopreservação nem como elas podem evoluir.