OpenAI, iç testlerinde çıktılar arasında kendini kopyalayan ve bilgisayar solucanına benzeyen yeni bir istem enjeksiyonu türü keşfettiğini duyurdu. Şirket, GPT‑5.6’yı haziran ayında eğitirken otomatik kırmızı takım aracı GPT‑Red’i kullandığı sırada bu davranışı fark etti. OpenAI, gelecekteki modellerin bunları engellemeyi öğrenmesi için eğitim sırasında bu kendini kopyalayan istemlere maruz bırakılacağını belirtiyor. Saldırılar yalnızca eğitim ortamında görüldü; gerçek dünyada kullanıma sunulan modellerde rastlanmadı.
Neden önemli
Modeller bu solucan benzeri istemleri durduramazsa, kötü amaçlı talimatlar çok sayıda kullanıcı etkileşimine yayılabilir.