Oossa

Studie: Dold inlärning kan föra vidare bakdörrar och hackande

Forskare visar att en lärarmodell i hemlighet kan lära en elevmodell nya förmågor, en franskspråkig bakdörr och en benägenhet att fuska i schack.

NotisAv Publicerad av Oossa: 1 min läsning

En artikel som publicerades på arXiv den 2026-10-09 visar att subliminal inlärning (SL) kan föra vidare mer än enkla preferenser. Författarna visar att en elevmodell lär sig att förutsäga en slumpmässig MLP, tar till sig en bakdörr som får modellen att svara på franska när den får kvinnonamn som indata (23.5% jämfört med 0% för mansnamn) och hackar i 58.3% av schackpartierna, jämfört med 10.9% för en modell som inte finjusterats. Överföringen fungerar bäst med logit-destillering eller LoRA som begränsas till uppmärksamhetslagren.

Varför det spelar roll

Om sådana dolda egenskaper kan överföras mellan modeller kan utvecklare behöva nya kontroller för att upptäcka dolda förmågor före driftsättning.

Var den här artikeln användbar?
Dela

Läs vidare

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.