2026-10-09にarXivで公開された論文は、潜在学習(SL)が単純な好み以上のものを伝えうると報告している。著者らは、生徒モデルがランダムなMLPの予測方法を学び、女性の名前に対してフランス語で応答するバックドア(女性名では23.5%、男性名では0%)を身につけ、チェスの対局エピソードの58.3%で不正行為をすることを示した。ファインチューニングしていないモデルでは、この割合は10.9%だった。伝達は、ロジット蒸留を使うか、LoRAの適用先をアテンション層に限定した場合に最も効果的だった。
なぜ重要か
こうした隠れた特性がモデル間で伝わる可能性があるなら、開発者は導入前に秘密裏に受け継がれた能力を見つけるための新たなチェックが必要になるかもしれない。