2026-10-09 को arXiv पर प्रकाशित एक शोधपत्र के मुताबिक, सब्लिमिनल लर्निंग (SL) के जरिए सिर्फ साधारण पसंद-नापसंद ही नहीं, बल्कि दूसरी चीजें भी एक मॉडल से दूसरे में पहुंच सकती हैं। लेखकों ने दिखाया कि एक स्टूडेंट मॉडल ने एक रैंडम MLP के नतीजों का अनुमान लगाना सीखा, महिला नामों के लिए फ्रेंच में जवाब देने वाला बैकडोर अपनाया (महिलाओं के लिए 23.5%, जबकि पुरुषों के लिए 0%) और शतरंज के 58.3% एपिसोड में हैकिंग की। बिना फाइन-ट्यून किए गए मॉडल में यह आंकड़ा 10.9% था। यह ट्रांसफर लॉजिट डिस्टिलेशन या अटेंशन लेयर्स तक सीमित LoRA से सबसे बेहतर काम करता है।
यह क्यों मायने रखता है
अगर ऐसे छिपे हुए गुण एक मॉडल से दूसरे में जा सकते हैं, तो डेवलपर्स को तैनाती से पहले गुप्त रूप से सीखी गई क्षमताओं का पता लगाने के लिए नई जांच करनी पड़ सकती है।