# Ny modell förutsäger hur AI-jailbreakattacker skalar med antalet försök

> Forskare under ledning av Marco Biroli publicerade den 29 september 2026 en artikel med en enkel formel för att uppskatta hur ofta jailbreakförsök lyckas när angripare testar fler promptar.

Oossa · 2026-09-29 · https://oossa.com/sv/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Den 29 september 2026 publicerade datavetaren Marco Biroli en artikel på arXiv med titeln ”Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking”. Arbetet presenterar en enkel ”barriärmodell” som förklarar hur stor andel jailbreakattacker som lyckas när en angripare ökar två variabler: antalet promptvarianter (N) och antalet svar per variant (M). Modellen bygger på bara fyra tal kopplade till säkerhetsmekanismer, men kan ändå förutsäga resultaten av betydligt större attacker än dem som hittills har testats.

## Vad gör den nya modellen?

Modellen utgår från att varje prompt har en grundläggande säkerhetsnivå och lägger sedan till en slumpmässig ”barriär” som angriparen kan ta sig förbi genom att testa tillräckligt många varianter. Genom att anpassa de fyra talen efter data från fem olika språkmodeller visar författarna att resultaten för alla fem följer samma skalningskurva. Det gör att de kan extrapolera från experiment med upp till 100 promptvarianter till scenarier med 10 000 varianter – något som tidigare studier inte kunde göra på ett tillförlitligt sätt.

Artikeln undersöker också hur genereringstemperaturen – en inställning som styr slumpmässigheten i AI-svar – påverkar hur ofta attacker lyckas. Med samma fyra tal kan författarna förutsäga framgångsgraden vid temperaturer som de aldrig testat.

## Varför det spelar roll för AI-säkerheten

Om modellens förutsägelser håller kan säkerhetsingenjörer uppskatta hur många promptvarianter en angripare behöver testa innan en jailbreakattack sannolikt lyckas. Det hjälper dem att sätta realistiska gränser för hur många promptar som kan tillåtas i offentliga API:er och att avgöra hur noga misstänkta mönster bör övervakas.

Arbetet ifrågasätter också tidigare påståenden om att attackernas framgång följer ett enkelt potenssamband med N. Genom att visa en mer nyanserad kurva som beror på temperaturen tyder det på att försvar måste ta hänsyn till flera faktorer, inte bara antalet försök.

## Fakta

- Artikeln publicerades på arXiv den 29 september 2026.
- Marco Biroli anges som studiens enda författare.
- Modellen anpassas efter data från fem olika språkmodeller med hjälp av bara fyra säkerhetsrelaterade parametrar.
- Den kan extrapolera attackernas framgångsgrad från N ≤ 100 till N = 10⁴ promptvarianter.
- Författarna visar att exponenten för framgångsgraden förändras med N, vilket motsäger antagandet om ett enkelt potenssamband.

## Varför det spelar roll

Modellen ger AI-utvecklare ett snabbt sätt att uppskatta hur svårt det är för angripare att ta sig förbi säkerhetsspärrar, vilket kan vägleda gränser för API:er och övervakningsverktyg. Den visar också att det kan vara otillräckligt att bara mäta antalet försök, eftersom andra faktorer också kan göra jailbreakattacker lättare.

## Källor och referenser

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Senast uppdaterad: 2026-09-29
