# Nieuw model voorspelt hoe jailbreakaanvallen op AI opschalen met meer inspanning

> Onderzoekers onder leiding van Marco Biroli publiceerden op 29 september 2026 een artikel met een eenvoudige formule om in te schatten hoe vaak jailbreakpogingen slagen wanneer aanvallers meer prompts proberen.

Oossa · 2026-09-29 · https://oossa.com/nl/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Op 29 september 2026 plaatste computerwetenschapper Marco Biroli een artikel op arXiv met de titel ‘Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking’. Het onderzoek introduceert een eenvoudig ‘barrièremodel’ dat verklaart hoe het slagingspercentage van jailbreakaanvallen verandert wanneer een aanvaller twee variabelen opvoert: het aantal promptvarianten (N) en het aantal antwoorden per variant (M). Het model gebruikt slechts vier getallen die verband houden met veiligheidsmechanismen, maar kan uitkomsten voorspellen voor veel grotere aanvallen dan tot nu toe zijn getest.

## Wat doet het nieuwe model?

Het model gaat ervan uit dat elke prompt een basisniveau van veiligheid heeft, en voegt daar vervolgens een willekeurige ‘barrière’ aan toe die kan worden overwonnen als de aanvaller genoeg varianten probeert. Door de vier getallen af te stemmen op gegevens van vijf verschillende taalmodellen, laten de auteurs zien dat alle vijf op dezelfde schaalcurve uitkomen. Zo kunnen ze experimenten met maximaal 100 promptvarianten extrapoleren naar scenario’s met 10.000 varianten, iets wat eerdere onderzoeken niet betrouwbaar konden.

Het artikel onderzoekt ook hoe de generatietemperatuur – een instelling die de mate van willekeur in AI-uitvoer bepaalt – het succes van aanvallen beïnvloedt. Met dezelfde vier getallen kunnen de auteurs slagingspercentages voorspellen bij temperaturen die ze niet hebben getest.

## Waarom dit belangrijk is voor AI-veiligheid

Als de voorspellingen van het model standhouden, kunnen veiligheidstechnici inschatten hoeveel promptvarianten een aanvaller nodig heeft voordat een jailbreak waarschijnlijk wordt. Dat helpt hen realistische limieten vast te stellen voor het aantal prompts dat via openbare API’s is toegestaan, en te bepalen hoe scherp ze verdachte patronen moeten volgen.

Het onderzoek zet ook vraagtekens bij eerdere beweringen dat het succes van aanvallen een eenvoudige machtswet volgt naarmate N toeneemt. De auteurs laten een genuanceerdere, temperatuurafhankelijke curve zien, wat erop wijst dat verdedigers met meerdere factoren rekening moeten houden, niet alleen met het aantal pogingen.

## De feiten

- Het artikel werd op 29 september 2026 op arXiv geplaatst.
- Marco Biroli staat als enige auteur van het onderzoek vermeld.
- Het model past gegevens van vijf verschillende taalmodellen met slechts vier veiligheidsgerelateerde parameters.
- Het kan slagingspercentages van aanvallen extrapoleren van N ≤ 100 naar N = 10⁴ promptvarianten.
- Volgens de auteurs verandert de exponent van het slagingspercentage naarmate N toeneemt, wat in tegenspraak is met de aanname van een eenvoudige machtswet.

## Waarom het ertoe doet

Het model biedt AI-ontwikkelaars een snelle manier om in te schatten hoe moeilijk het voor aanvallers is om veiligheidsmaatregelen te omzeilen. Dat kan helpen bij het bepalen van API-limieten en de ontwikkeling van monitoringtools. Ook waarschuwt het dat wie alleen kijkt naar één maatstaf, zoals het aantal pogingen, mogelijk andere factoren over het hoofd ziet die jailbreaks makkelijker maken.

## Bronnen en referenties

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Laatst bijgewerkt: 2026-09-29
