OossaAI ontwikkelt zich snel. Wij leggen het eenvoudig uit.
Nieuwsbrief

· 1 min lezen

Nieuw model voorspelt hoe jailbreakaanvallen op AI opschalen met meer inspanning

Onderzoekers onder leiding van Marco Biroli publiceerden op 29 september 2026 een artikel met een eenvoudige formule om in te schatten hoe vaak jailbreakpogingen slagen wanneer aanvallers meer prompts proberen.

Oossa · Over Oossa

Nieuw model voorspelt hoe jailbreakaanvallen op AI opschalen met meer inspanning
Photo by FlyD on Unsplash

Op 29 september 2026 plaatste computerwetenschapper Marco Biroli een artikel op arXiv met de titel ‘Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking’. Het onderzoek introduceert een eenvoudig ‘barrièremodel’ dat verklaart hoe het slagingspercentage van jailbreakaanvallen verandert wanneer een aanvaller twee variabelen opvoert: het aantal promptvarianten (N) en het aantal antwoorden per variant (M). Het model gebruikt slechts vier getallen die verband houden met veiligheidsmechanismen, maar kan uitkomsten voorspellen voor veel grotere aanvallen dan tot nu toe zijn getest.

Wat doet het nieuwe model?

Het model gaat ervan uit dat elke prompt een basisniveau van veiligheid heeft, en voegt daar vervolgens een willekeurige ‘barrière’ aan toe die kan worden overwonnen als de aanvaller genoeg varianten probeert. Door de vier getallen af te stemmen op gegevens van vijf verschillende taalmodellen, laten de auteurs zien dat alle vijf op dezelfde schaalcurve uitkomen. Zo kunnen ze experimenten met maximaal 100 promptvarianten extrapoleren naar scenario’s met 10.000 varianten, iets wat eerdere onderzoeken niet betrouwbaar konden.

Het artikel onderzoekt ook hoe de generatietemperatuur – een instelling die de mate van willekeur in AI-uitvoer bepaalt – het succes van aanvallen beïnvloedt. Met dezelfde vier getallen kunnen de auteurs slagingspercentages voorspellen bij temperaturen die ze niet hebben getest.

Waarom dit belangrijk is voor AI-veiligheid

Als de voorspellingen van het model standhouden, kunnen veiligheidstechnici inschatten hoeveel promptvarianten een aanvaller nodig heeft voordat een jailbreak waarschijnlijk wordt. Dat helpt hen realistische limieten vast te stellen voor het aantal prompts dat via openbare API’s is toegestaan, en te bepalen hoe scherp ze verdachte patronen moeten volgen.

Het onderzoek zet ook vraagtekens bij eerdere beweringen dat het succes van aanvallen een eenvoudige machtswet volgt naarmate N toeneemt. De auteurs laten een genuanceerdere, temperatuurafhankelijke curve zien, wat erop wijst dat verdedigers met meerdere factoren rekening moeten houden, niet alleen met het aantal pogingen.

Waarom het ertoe doet

Het model biedt AI-ontwikkelaars een snelle manier om in te schatten hoe moeilijk het voor aanvallers is om veiligheidsmaatregelen te omzeilen. Dat kan helpen bij het bepalen van API-limieten en de ontwikkeling van monitoringtools. Ook waarschuwt het dat wie alleen kijkt naar één maatstaf, zoals het aantal pogingen, mogelijk andere factoren over het hoofd ziet die jailbreaks makkelijker maken.

Was dit artikel nuttig?

Bronnen en referenties

#BronMediumDatumKernpunt
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 sep 2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 bronnen

Laatst bijgewerkt:

Oossallms.txt.md

Delen

Oossa · Nieuwsbrief

De AI-week, uitgelegd

Elke maandag: het nieuws dat ertoe doet, in gewone taal. Gratis, geen spam.

Nieuw model voorspelt hoe jailbreakaanvallen op AI opschalen met meer inspanning – Oossa