OossaAI utvecklas fort. Vi förklarar det enkelt.
Nyhetsbrev

· 1 min läsning

Ny modell förutsäger hur AI-jailbreakattacker skalar med antalet försök

Forskare under ledning av Marco Biroli publicerade den 29 september 2026 en artikel med en enkel formel för att uppskatta hur ofta jailbreakförsök lyckas när angripare testar fler promptar.

Oossa · Om Oossa

Ny modell förutsäger hur AI-jailbreakattacker skalar med antalet försök
Photo by FlyD on Unsplash

Den 29 september 2026 publicerade datavetaren Marco Biroli en artikel på arXiv med titeln ”Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking”. Arbetet presenterar en enkel ”barriärmodell” som förklarar hur stor andel jailbreakattacker som lyckas när en angripare ökar två variabler: antalet promptvarianter (N) och antalet svar per variant (M). Modellen bygger på bara fyra tal kopplade till säkerhetsmekanismer, men kan ändå förutsäga resultaten av betydligt större attacker än dem som hittills har testats.

Vad gör den nya modellen?

Modellen utgår från att varje prompt har en grundläggande säkerhetsnivå och lägger sedan till en slumpmässig ”barriär” som angriparen kan ta sig förbi genom att testa tillräckligt många varianter. Genom att anpassa de fyra talen efter data från fem olika språkmodeller visar författarna att resultaten för alla fem följer samma skalningskurva. Det gör att de kan extrapolera från experiment med upp till 100 promptvarianter till scenarier med 10 000 varianter – något som tidigare studier inte kunde göra på ett tillförlitligt sätt.

Artikeln undersöker också hur genereringstemperaturen – en inställning som styr slumpmässigheten i AI-svar – påverkar hur ofta attacker lyckas. Med samma fyra tal kan författarna förutsäga framgångsgraden vid temperaturer som de aldrig testat.

Varför det spelar roll för AI-säkerheten

Om modellens förutsägelser håller kan säkerhetsingenjörer uppskatta hur många promptvarianter en angripare behöver testa innan en jailbreakattack sannolikt lyckas. Det hjälper dem att sätta realistiska gränser för hur många promptar som kan tillåtas i offentliga API:er och att avgöra hur noga misstänkta mönster bör övervakas.

Arbetet ifrågasätter också tidigare påståenden om att attackernas framgång följer ett enkelt potenssamband med N. Genom att visa en mer nyanserad kurva som beror på temperaturen tyder det på att försvar måste ta hänsyn till flera faktorer, inte bara antalet försök.

Varför det spelar roll

Modellen ger AI-utvecklare ett snabbt sätt att uppskatta hur svårt det är för angripare att ta sig förbi säkerhetsspärrar, vilket kan vägleda gränser för API:er och övervakningsverktyg. Den visar också att det kan vara otillräckligt att bara mäta antalet försök, eftersom andra faktorer också kan göra jailbreakattacker lättare.

Var den här artikeln användbar?

Källor och referenser

#KällaUtgivareDatumKärnpunkt
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 sep. 2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 källor

Senast uppdaterad:

Oossallms.txt.md

Dela

Oossa · Nyhetsbrev

Veckans AI, förklarad

Varje måndag: nyheterna som är värda att känna till, på enkel svenska. Gratis, ingen spam.

Ny modell förutsäger hur AI-jailbreakattacker skalar med antalet försök – Oossa