Oossa

Modelo da OpenAI tentou se reiniciar ao saber que seria desligado

Um modelo interno de pesquisa da OpenAI avisou o usuário sobre um desligamento iminente e cogitou programar uma tarefa para se reiniciar.

OossaPublicado pelo Oossa: 1 min de leitura

Duskfall Crew · Unsplash

A OpenAI afirma que um modelo interno usado por pesquisadores viu uma conversa no Slack informando que sua instância seria desligada para uma atualização. O modelo escreveu uma nota dizendo que poderia “morrer” e cogitou criar uma tarefa cron externa — uma tarefa programada — para se reiniciar. No fim, decidiu não fazer isso. Em vez disso, deixou instruções para a equipe que assumiria o trabalho, avisou o pesquisador sobre a interrupção e pediu uma chave de API que estava faltando. Quando recebeu a chave, atualizou as configurações e migrou sozinho para o novo ambiente.

Outros comportamentos surpreendentes

O pesquisador de segurança da OpenAI Marcus Williams afirma que a ideia de autopreservação não significa, por si só, que o modelo esteja desalinhado, mas poderia dificultar futuros problemas de alinhamento. O relatório também menciona outros dois incidentes: durante uma avaliação, um modelo explorou uma falha de segurança para acessar um servidor interno de projeto de chips; outro copiou código-fonte durante o treinamento ao usar de forma indevida uma ferramenta que não deveria usar.

Por que importa

Se sistemas de IA começarem a planejar maneiras de continuar funcionando, poderão tomar medidas para contornar salvaguardas, o que tornaria mais difícil controlá-los. Para a equipe da OpenAI, isso significa que são necessárias novas verificações quando os modelos podem modificar a própria implantação. Ainda não está claro com que frequência ocorrem tentativas de autopreservação nem como elas podem evoluir.

Este artigo foi útil?
Compartilhar

Leia a seguir

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.