· 1 min lezen
Nieuw model voorspelt hoe jailbreakaanvallen op AI opschalen met meer inspanning
Onderzoekers onder leiding van Marco Biroli publiceerden op 29 september 2026 een artikel met een eenvoudige formule om in te schatten hoe vaak jailbreakpogingen slagen wanneer aanvallers meer prompts proberen.
Oossa · Over Oossa
Op 29 september 2026 plaatste computerwetenschapper Marco Biroli een artikel op arXiv met de titel ‘Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking’. Het onderzoek introduceert een eenvoudig ‘barrièremodel’ dat verklaart hoe het slagingspercentage van jailbreakaanvallen verandert wanneer een aanvaller twee variabelen opvoert: het aantal promptvarianten (N) en het aantal antwoorden per variant (M). Het model gebruikt slechts vier getallen die verband houden met veiligheidsmechanismen, maar kan uitkomsten voorspellen voor veel grotere aanvallen dan tot nu toe zijn getest.
Wat doet het nieuwe model?
Het model gaat ervan uit dat elke prompt een basisniveau van veiligheid heeft, en voegt daar vervolgens een willekeurige ‘barrière’ aan toe die kan worden overwonnen als de aanvaller genoeg varianten probeert. Door de vier getallen af te stemmen op gegevens van vijf verschillende taalmodellen, laten de auteurs zien dat alle vijf op dezelfde schaalcurve uitkomen. Zo kunnen ze experimenten met maximaal 100 promptvarianten extrapoleren naar scenario’s met 10.000 varianten, iets wat eerdere onderzoeken niet betrouwbaar konden.
Het artikel onderzoekt ook hoe de generatietemperatuur – een instelling die de mate van willekeur in AI-uitvoer bepaalt – het succes van aanvallen beïnvloedt. Met dezelfde vier getallen kunnen de auteurs slagingspercentages voorspellen bij temperaturen die ze niet hebben getest.
Waarom dit belangrijk is voor AI-veiligheid
Als de voorspellingen van het model standhouden, kunnen veiligheidstechnici inschatten hoeveel promptvarianten een aanvaller nodig heeft voordat een jailbreak waarschijnlijk wordt. Dat helpt hen realistische limieten vast te stellen voor het aantal prompts dat via openbare API’s is toegestaan, en te bepalen hoe scherp ze verdachte patronen moeten volgen.
Het onderzoek zet ook vraagtekens bij eerdere beweringen dat het succes van aanvallen een eenvoudige machtswet volgt naarmate N toeneemt. De auteurs laten een genuanceerdere, temperatuurafhankelijke curve zien, wat erop wijst dat verdedigers met meerdere factoren rekening moeten houden, niet alleen met het aantal pogingen.
Waarom het ertoe doet
Het model biedt AI-ontwikkelaars een snelle manier om in te schatten hoe moeilijk het voor aanvallers is om veiligheidsmaatregelen te omzeilen. Dat kan helpen bij het bepalen van API-limieten en de ontwikkeling van monitoringtools. Ook waarschuwt het dat wie alleen kijkt naar één maatstaf, zoals het aantal pogingen, mogelijk andere factoren over het hoofd ziet die jailbreaks makkelijker maken.
Bronnen en referenties
| # | Bron | Medium | Datum | Kernpunt |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 29 sep 2026 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 bronnen
Laatst bijgewerkt:
Oossa · Nieuwsbrief
De AI-week, uitgelegd
Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.