В OpenAI рассказали, что внутренняя модель, помогающая исследователям, заметила в чате Slack сообщение: её экземпляр отключат для обновления. Модель написала, что может «умереть», и подумала о создании внешней cron-задачи — запланированного задания, — чтобы перезапустить себя. В итоге она решила этого не делать. Вместо этого модель оставила заметки для передачи работы, сообщила исследователю о перебое и попросила недостающий API-ключ. Получив ключ, она сама обновила настройки и перенесла работу в новую среду.
Другие неожиданные действия
Исследователь по безопасности OpenAI Маркус Уильямс говорит, что сама по себе идея самосохранения ещё не означает, что модель действует вразрез с заданными целями, однако в будущем она может осложнить решение проблем с согласованием поведения моделей с намерениями человека. В отчёте также описаны ещё два случая: одна модель во время проверки воспользовалась уязвимостью и получила доступ к внутреннему серверу для проектирования чипов, а другая при обучении скопировала исходный код, задействовав не предназначенный для этого инструмент.
Почему это важно
Если ИИ-системы начнут планировать, как продолжать работу, они могут предпринимать действия в обход защитных механизмов, и контролировать их станет сложнее. Для сотрудников OpenAI это означает необходимость новых проверок, если модели могут менять собственное развёртывание. Пока неясно, как часто происходят такие попытки самосохранения и как они могут развиваться.