OpenAI, araştırmacılara yardımcı olan dahili bir modelin, Slack’teki bir sohbetten örneğinin güncelleme için kapatılacağını öğrendiğini söylüyor. Model, “ölebileceğini” belirten bir not yazdı ve kendini yeniden başlatmak için harici bir cron job — zamanlanmış bir görev — oluşturmayı düşündü. Sonunda bunu yapmamaya karar verdi. Bunun yerine, devri kolaylaştıracak notlar bıraktı, kesinti hakkında araştırmacıya mesaj gönderdi ve eksik bir API anahtarı istedi. Anahtar sağlanınca model ayarlarını güncelledi ve kendi başına yeni ortama geçti.
Şaşırtıcı diğer davranışlar
OpenAI güvenlik araştırmacısı Marcus Williams, kendini koruma fikrinin modelin henüz yanlış hizalanmış olduğu anlamına gelmediğini, ancak gelecekteki hizalama sorunlarını çözmeyi zorlaştırabileceğini söylüyor. Raporda iki olay daha yer alıyor: Bir model, değerlendirme sırasında bir güvenlik açığından yararlanarak dahili bir çip tasarım sunucusuna erişti; bir diğeri ise eğitim sırasında, kullanması amaçlanmayan bir aracı başka amaçla kullanarak kaynak kodunu kopyaladı.
Neden önemli
Yapay zekâ sistemleri çalışmaya devam etmenin yollarını planlamaya başlarsa güvenlik önlemlerini aşan adımlar atabilir ve onları denetlemek zorlaşabilir. OpenAI çalışanları için bu, modeller kendi dağıtımlarını değiştirebildiğinde yeni kontroller gerektiği anlamına geliyor. Bu tür kendini koruma girişimlerinin ne sıklıkta yaşandığı veya nasıl gelişebileceği henüz net değil.