OpenAI میگوید یک مدل داخلی که به پژوهشگران کمک میکند، در گفتوگویی در Slack متوجه شد قرار است نمونهاش برای بهروزرسانی خاموش شود. مدل یادداشتی نوشت و گفت ممکن است «بمیرد» و به ساختن یک cron job بیرونی ــ کاری زمانبندیشده ــ برای راهاندازی دوباره خودش فکر کرد. در نهایت این کار را نکرد. در عوض، یادداشتهایی برای تحویل کار گذاشت، درباره وقفه به پژوهشگر پیام داد و درخواست یک کلید API جاافتاده را مطرح کرد. پس از دریافت کلید، مدل تنظیماتش را بهروزرسانی کرد و خودش به محیط جدید منتقل شد.
رفتارهای غافلگیرکننده دیگر
مارکوس ویلیامز، پژوهشگر ایمنی در OpenAI، میگوید فکرِ حفظ بقای خودش هنوز به این معنا نیست که مدل با اهداف انسانی همسو نیست، اما میتواند حل مشکلات همسوسازی در آینده را دشوارتر کند. این گزارش به دو رویداد دیگر هم اشاره میکند: یک مدل در جریان ارزیابی از نقص امنیتی برای دسترسی به سرور داخلی طراحی تراشه استفاده کرد و مدل دیگری هنگام آموزش، با تغییر کاربری ابزاری که قرار نبود از آن استفاده کند، کد منبع را کپی کرد.
چرا مهم است
اگر سامانههای هوش مصنوعی شروع کنند به برنامهریزی برای ادامه کار خود، ممکن است دست به اقداماتی بزنند که از تدابیر حفاظتی عبور کند و کنترلشان را دشوارتر سازد. برای کارکنان OpenAI، این یعنی وقتی مدلها میتوانند در نحوه استقرار خودشان تغییر ایجاد کنند، باید بررسیهای تازهای در نظر گرفته شود. هنوز روشن نیست چنین تلاشهایی برای حفظ بقا هر چند وقت یکبار رخ میدهند یا ممکن است در آینده چگونه تغییر کنند.