# Neues Modell sagt voraus, wie Jailbreak-Angriffe auf KI mit dem Aufwand skalieren

> Ein Forschungsteam unter der Leitung von Marco Biroli hat am 29. September 2026 eine Studie veröffentlicht. Sie stellt eine einfache Formel vor, mit der sich abschätzen lässt, wie oft Jailbreak-Versuche erfolgreich sind, wenn Angreifer mehr Prompts ausprobieren.

Oossa · 2026-09-29 · https://oossa.com/de/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Am 29. September 2026 veröffentlichte der Informatiker Marco Biroli auf arXiv eine Studie mit dem Titel „Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking“. Die Arbeit stellt ein einfaches „Barrierenmodell“ vor, das erklärt, wie sich die Erfolgsquote von Jailbreak-Angriffen verändert, wenn ein Angreifer zwei Variablen erhöht: die Zahl der Prompt-Varianten (N) und die Zahl der Antworten pro Variante (M). Das Modell benötigt nur vier Kennzahlen zu Sicherheitsmechanismen und kann dennoch Ergebnisse für deutlich größere Angriffe vorhersagen, als bisher getestet wurden.

## Was leistet das neue Modell?

Das Modell geht davon aus, dass jeder Prompt ein grundlegendes Sicherheitsniveau hat, und ergänzt eine zufällige „Barriere“, die sich durch genügend Versuche mit unterschiedlichen Varianten überwinden lässt. Indem die Autoren die vier Kennzahlen an Daten von fünf verschiedenen Sprachmodellen anpassen, zeigen sie, dass alle fünf auf dieselbe Skalierungskurve fallen. Dadurch können sie von Experimenten mit bis zu 100 Prompt-Varianten auf Szenarien mit 10 000 Varianten hochrechnen – etwas, das frühere Studien nicht zuverlässig leisten konnten.

Die Studie untersucht außerdem, wie sich die Generierungstemperatur – ein Regler für die Zufälligkeit der KI-Ausgaben – auf den Erfolg von Angriffen auswirkt. Mit denselben vier Kennzahlen können die Autoren Erfolgsraten auch für Temperaturen vorhersagen, die sie nie getestet haben.

## Warum das für die KI-Sicherheit wichtig ist

Sollten sich die Vorhersagen des Modells bestätigen, können Sicherheitsteams abschätzen, wie viele Prompt-Varianten ein Angreifer ausprobieren müsste, damit ein Jailbreak wahrscheinlich wird. Das hilft ihnen, realistische Grenzen dafür festzulegen, wie viele Prompts über öffentliche APIs zugelassen werden können und wie intensiv verdächtige Muster überwacht werden sollten.

Die Arbeit stellt auch frühere Aussagen infrage, wonach der Angriffserfolg einem einfachen Potenzgesetz in Abhängigkeit von N folgt. Die Autoren zeigen eine differenziertere, temperaturabhängige Kurve. Das deutet darauf hin, dass Abwehrmaßnahmen mehrere Faktoren berücksichtigen müssen – nicht nur die Zahl der Versuche.

## Die Fakten

- Die Studie wurde am 29. September 2026 auf arXiv veröffentlicht.
- Marco Biroli ist als alleiniger Autor der Studie aufgeführt.
- Das Modell passt Daten von fünf verschiedenen Sprachmodellen anhand von nur vier sicherheitsbezogenen Parametern an.
- Es kann Angriffserfolge von N ≤ 100 auf N = 10⁴ Prompt-Varianten hochrechnen.
- Die Autoren stellen fest, dass sich der Exponent der Erfolgsquote mit N verändert. Das widerspricht der Annahme eines einfachen Potenzgesetzes.

## Warum es wichtig ist

Das Modell gibt KI-Entwicklern eine schnelle Möglichkeit einzuschätzen, wie schwer es Angreifern fällt, Sicherheitsvorkehrungen zu umgehen. Das kann als Grundlage für API-Beschränkungen und Überwachungstools dienen. Zugleich warnt es davor, sich auf eine einzelne Kennzahl wie die Zahl der Versuche zu verlassen, da weitere Faktoren Jailbreaks erleichtern können.

## Quellen und Referenzen

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Zuletzt aktualisiert: 2026-09-29
