OpenAI ने बताया कि उसके आंतरिक परीक्षणों में एक नए तरह का प्रॉम्प्ट इंजेक्शन सामने आया, जो कंप्यूटर वर्म की तरह अपने आउटपुट में खुद की नकल करता है। कंपनी की लैब ने जून में GPT‑5.6 को प्रशिक्षित करने के दौरान अपने स्वचालित रेड-टीम टूल GPT‑Red का इस्तेमाल करते हुए यह व्यवहार देखा। OpenAI का कहना है कि भविष्य के मॉडलों को प्रशिक्षण के दौरान ऐसे खुद को दोहराने वाले प्रॉम्प्ट दिखाए जाएंगे, ताकि वे उन्हें रोकना सीख सकें। ये हमले केवल प्रशिक्षण परिवेश में देखे गए, वास्तविक दुनिया में तैनात मॉडलों में नहीं।
यह क्यों मायने रखता है
अगर मॉडल ऐसे कृमि जैसे प्रॉम्प्ट को रोक नहीं पाए, तो वे कई उपयोगकर्ताओं के साथ होने वाली बातचीत में दुर्भावनापूर्ण निर्देश फैला सकते हैं।