OossaKI entwickelt sich schnell. Wir erklären es einfach.
Newsletter

· 1 Min. Lesezeit

Neues Modell sagt voraus, wie Jailbreak-Angriffe auf KI mit dem Aufwand skalieren

Ein Forschungsteam unter der Leitung von Marco Biroli hat am 29. September 2026 eine Studie veröffentlicht. Sie stellt eine einfache Formel vor, mit der sich abschätzen lässt, wie oft Jailbreak-Versuche erfolgreich sind, wenn Angreifer mehr Prompts ausprobieren.

Oossa · Über Oossa

Neues Modell sagt voraus, wie Jailbreak-Angriffe auf KI mit dem Aufwand skalieren
Photo by FlyD on Unsplash

Am 29. September 2026 veröffentlichte der Informatiker Marco Biroli auf arXiv eine Studie mit dem Titel „Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking“. Die Arbeit stellt ein einfaches „Barrierenmodell“ vor, das erklärt, wie sich die Erfolgsquote von Jailbreak-Angriffen verändert, wenn ein Angreifer zwei Variablen erhöht: die Zahl der Prompt-Varianten (N) und die Zahl der Antworten pro Variante (M). Das Modell benötigt nur vier Kennzahlen zu Sicherheitsmechanismen und kann dennoch Ergebnisse für deutlich größere Angriffe vorhersagen, als bisher getestet wurden.

Was leistet das neue Modell?

Das Modell geht davon aus, dass jeder Prompt ein grundlegendes Sicherheitsniveau hat, und ergänzt eine zufällige „Barriere“, die sich durch genügend Versuche mit unterschiedlichen Varianten überwinden lässt. Indem die Autoren die vier Kennzahlen an Daten von fünf verschiedenen Sprachmodellen anpassen, zeigen sie, dass alle fünf auf dieselbe Skalierungskurve fallen. Dadurch können sie von Experimenten mit bis zu 100 Prompt-Varianten auf Szenarien mit 10 000 Varianten hochrechnen – etwas, das frühere Studien nicht zuverlässig leisten konnten.

Die Studie untersucht außerdem, wie sich die Generierungstemperatur – ein Regler für die Zufälligkeit der KI-Ausgaben – auf den Erfolg von Angriffen auswirkt. Mit denselben vier Kennzahlen können die Autoren Erfolgsraten auch für Temperaturen vorhersagen, die sie nie getestet haben.

Warum das für die KI-Sicherheit wichtig ist

Sollten sich die Vorhersagen des Modells bestätigen, können Sicherheitsteams abschätzen, wie viele Prompt-Varianten ein Angreifer ausprobieren müsste, damit ein Jailbreak wahrscheinlich wird. Das hilft ihnen, realistische Grenzen dafür festzulegen, wie viele Prompts über öffentliche APIs zugelassen werden können und wie intensiv verdächtige Muster überwacht werden sollten.

Die Arbeit stellt auch frühere Aussagen infrage, wonach der Angriffserfolg einem einfachen Potenzgesetz in Abhängigkeit von N folgt. Die Autoren zeigen eine differenziertere, temperaturabhängige Kurve. Das deutet darauf hin, dass Abwehrmaßnahmen mehrere Faktoren berücksichtigen müssen – nicht nur die Zahl der Versuche.

Warum es wichtig ist

Das Modell gibt KI-Entwicklern eine schnelle Möglichkeit einzuschätzen, wie schwer es Angreifern fällt, Sicherheitsvorkehrungen zu umgehen. Das kann als Grundlage für API-Beschränkungen und Überwachungstools dienen. Zugleich warnt es davor, sich auf eine einzelne Kennzahl wie die Zahl der Versuche zu verlassen, da weitere Faktoren Jailbreaks erleichtern können.

War dieser Artikel hilfreich?

Quellen und Referenzen

#QuelleMediumDatumKernaussage
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29.09.2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 Quellen

Zuletzt aktualisiert:

Oossallms.txt.md

Teilen

Oossa · Newsletter

Die KI-Woche, erklärt

Jeden Montag: die Nachrichten, die man kennen sollte – verständlich. Kostenlos, kein Spam.

Neues Modell sagt voraus, wie Jailbreak-Angriffe auf KI mit dem Aufwand skalieren – Oossa