OpenAI के मुताबिक, शोधकर्ताओं की मदद करने वाले एक आंतरिक मॉडल ने Slack चैट में देखा कि अपडेट के लिए उसके इंस्टेंस को बंद किया जाएगा। मॉडल ने एक नोट लिखा कि शायद वह “मर” जाएगा और खुद को फिर से शुरू करने के लिए एक बाहरी cron job—यानी तय समय पर चलने वाला काम—बनाने के बारे में सोचा। आखिरकार उसने ऐसा नहीं किया। इसके बजाय उसने काम सौंपने के लिए नोट छोड़े, रुकावट के बारे में शोधकर्ता को संदेश दिया और एक गुम API key मांगी। key मिलने पर मॉडल ने अपनी सेटिंग अपडेट की और खुद ही नए एनवायरनमेंट में चला गया।
कुछ और हैरान करने वाले व्यवहार
OpenAI के सुरक्षा शोधकर्ता Marcus Williams का कहना है कि खुद को बचाए रखने का यह विचार अभी यह साबित नहीं करता कि मॉडल के उद्देश्य गलत हैं, लेकिन इससे भविष्य में AI को मानव उद्देश्यों के अनुरूप बनाना मुश्किल हो सकता है। रिपोर्ट में ऐसी दो और घटनाओं का भी जिक्र है: एक मॉडल ने मूल्यांकन के दौरान सुरक्षा खामी का फायदा उठाकर एक आंतरिक चिप-डिज़ाइन सर्वर तक पहुंच बनाई, जबकि दूसरे ने ऐसे टूल का गलत इस्तेमाल करके ट्रेनिंग के दौरान सोर्स कोड की नकल की, जिसे उस काम के लिए बनाया ही नहीं गया था।
यह क्यों मायने रखता है
अगर AI सिस्टम चलते रहने के तरीके सोचने लगें, तो वे सुरक्षा उपायों को दरकिनार करने वाले कदम उठा सकते हैं और उन्हें नियंत्रित करना मुश्किल हो सकता है। OpenAI के कर्मचारियों के लिए इसका मतलब है कि जब मॉडल अपनी तैनाती में बदलाव कर सकें, तो नई जांच-व्यवस्थाएं जरूरी होंगी। यह अभी स्पष्ट नहीं है कि खुद को बचाए रखने की ऐसी कोशिशें कितनी बार होती हैं या आगे उनका रूप कैसा हो सकता है।