أعلنت OpenAI أن اختباراتها الداخلية كشفت نوعًا جديدًا من حقن التعليمات ينسخ نفسه عبر المخرجات، على غرار دودة حاسوبية. ورصد المختبر هذا السلوك أثناء استخدام أداة الاختبار الآلي للفريق الأحمر GPT-Red لتدريب GPT-5.6 في يونيو. وتقول الشركة إن النماذج المقبلة ستتعرّض لهذه التعليمات ذاتية التكاثر أثناء التدريب، كي تتعلم حظرها. ولم تُرصد هذه الهجمات إلا في بيئة التدريب، لا في الاستخدامات الواقعية.
لماذا يهم
إذا عجزت النماذج عن إيقاف هذه التعليمات الشبيهة بالديدان، فقد تنشر تعليمات خبيثة عبر عدد كبير من تفاعلات المستخدمين.