# Un nouveau modèle prédit comment les attaques par jailbreak évoluent avec les efforts déployés

> Des chercheurs dirigés par Marco Biroli ont publié le 29 septembre 2026 un article proposant une formule simple pour estimer la fréquence de réussite des tentatives de jailbreak à mesure que les attaquants multiplient les prompts.

Oossa · 2026-09-29 · https://oossa.com/fr/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Le 29 septembre 2026, l’informaticien Marco Biroli a publié sur arXiv un article intitulé « Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking ». Il présente un « modèle de barrière » simple qui explique comment le taux de réussite des attaques par jailbreak évolue lorsque l’attaquant augmente deux variables : le nombre de variantes de prompt (N) et le nombre de réponses par variante (M). Le modèle ne repose que sur quatre paramètres liés aux mécanismes de sécurité, mais il peut prédire les résultats d’attaques bien plus vastes que celles testées jusqu’ici.

## Que permet le nouveau modèle ?

Le modèle attribue à chaque prompt un niveau de sécurité de base, auquel s’ajoute une « barrière » aléatoire que l’attaquant peut franchir en essayant suffisamment de variantes. En ajustant les quatre paramètres à partir de données provenant de cinq modèles de langage différents, les auteurs montrent que les résultats des cinq modèles suivent la même courbe de mise à l’échelle. Ils peuvent ainsi extrapoler des expériences menées avec jusqu’à 100 variantes de prompt à des scénarios en comptant 10 000, ce que les études précédentes ne permettaient pas de faire de manière fiable.

L’article examine également l’effet de la température de génération — un réglage qui contrôle le degré d’aléatoire des réponses de l’IA — sur la réussite des attaques. À l’aide des mêmes quatre paramètres, les auteurs peuvent prédire les taux de réussite à des températures qu’ils n’ont jamais testées.

## Pourquoi est-ce important pour la sécurité de l’IA ?

Si les prédictions du modèle se confirment, les ingénieurs chargés de la sécurité pourront estimer le nombre de variantes de prompt qu’un attaquant devrait essayer pour qu’un jailbreak devienne probable. Cela les aidera à fixer des limites réalistes au nombre de prompts autorisés par les API publiques et à déterminer avec quelle vigilance surveiller les comportements suspects.

Ces travaux remettent également en question des affirmations antérieures selon lesquelles la réussite des attaques suivrait une simple loi de puissance en fonction de N. En mettant en évidence une courbe plus nuancée, qui dépend de la température, ils suggèrent que les défenses doivent prendre en compte plusieurs facteurs, et pas seulement le nombre de tentatives.

## Les faits

- L’article a été publié sur arXiv le 29 septembre 2026.
- Marco Biroli est indiqué comme l’unique auteur de l’étude.
- Le modèle ajuste des données provenant de cinq modèles de langage différents à l’aide de seulement quatre paramètres liés à la sécurité.
- Il peut extrapoler les taux de réussite des attaques de N ≤ 100 à N = 10⁴ variantes de prompt.
- Les auteurs constatent que l’exposant du taux de réussite varie avec N, ce qui contredit l’hypothèse d’une simple loi de puissance.

## Pourquoi c'est important

Le modèle fournit aux développeurs d’IA un moyen rapide d’évaluer la difficulté pour les attaquants de contourner les garde-fous de sécurité, ce qui peut les aider à définir des limites pour les API et à concevoir des outils de surveillance. Il rappelle aussi que se fier à un seul indicateur, comme le nombre de tentatives, peut faire passer à côté d’autres facteurs qui facilitent les jailbreaks.

## Sources et références

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Dernière mise à jour: 2026-09-29
