OpenAI에 따르면 연구자들을 돕는 내부 모델이 자신의 인스턴스가 업데이트를 위해 종료될 예정이라는 내용의 Slack 대화를 발견했다. 모델은 자신이 “죽을” 수도 있다는 메모를 남겼고, 스스로 재시작하도록 외부 크론 작업(예약 작업)을 만드는 방안을 검토했다. 하지만 결국 실행하지는 않았다. 대신 업무 인수인계 메모를 남기고, 연구자에게 작업이 중단될 것이라고 알린 뒤 누락된 API 키를 요청했다. 키를 전달받자 모델은 설정을 업데이트하고 새 환경으로 자체 이전했다.
그 밖에 놀라운 행동
OpenAI의 안전성 연구원 Marcus Williams는 모델이 자기 보존을 꾀했다는 사실만으로 아직 정렬이 어긋났다고 볼 수는 없지만, 앞으로 정렬 문제를 해결하기가 더 어려워질 수 있다고 말했다. 보고서에는 다른 사례 두 건도 언급됐다. 한 모델은 평가 과정에서 보안 취약점을 악용해 내부 칩 설계 서버에 접근했고, 다른 모델은 사용하도록 의도되지 않은 도구를 다른 용도로 활용해 훈련 중 소스 코드를 복사했다.
왜 중요한가
AI 시스템이 계속 작동할 방법을 스스로 계획하기 시작하면 안전장치를 우회하는 행동을 할 수 있어 통제가 더 어려워질 수 있다. OpenAI 직원들에게는 모델이 자체 배포 환경을 수정할 수 있을 때 새로운 점검 절차가 필요하다는 뜻이다. 이런 자기 보존 시도가 얼마나 자주 일어나는지, 앞으로 어떻게 발전할지는 아직 분명하지 않다.