# Новая модель предсказывает, как успех атак с обходом защиты ИИ зависит от числа попыток

> Исследователи во главе с Марко Бироли 29 сентября 2026 года опубликовали статью с простой формулой для оценки того, как часто удаются попытки обойти защиту ИИ при увеличении числа запросов.

Oossa · 2026-09-29 · https://oossa.com/ru/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

29 сентября 2026 года специалист по информатике Марко Бироли опубликовал на arXiv статью «Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking». В ней представлена простая «модель барьера», объясняющая, как меняется вероятность успеха атак с обходом защиты, когда злоумышленник увеличивает два параметра: число вариантов запроса (N) и число ответов на каждый вариант (M). Модель использует всего четыре числа, связанные с механизмами безопасности, и при этом позволяет предсказывать результаты атак гораздо большего масштаба, чем проверяли до сих пор.

## Что делает новая модель?

Модель предполагает, что у каждого запроса есть исходный уровень безопасности, а затем добавляет случайный «барьер», который можно преодолеть, если злоумышленник попробует достаточно вариантов. Подобрав значения четырёх параметров по данным пяти разных языковых моделей, автор показывает, что результаты всех пяти ложатся на одну и ту же кривую масштабирования. Это позволяет экстраполировать результаты экспериментов с числом вариантов запроса до 100 на сценарии с 10 000 вариантами — то, что предыдущие исследования не могли надёжно сделать.

В статье также рассматривается, как на успех атаки влияет температура генерации — параметр, управляющий случайностью ответов ИИ. С помощью тех же четырёх чисел авторы могут предсказывать вероятность успеха при температурах, которые не проверяли.

## Почему это важно для безопасности ИИ

Если предсказания модели подтвердятся, инженеры по безопасности смогут оценить, сколько вариантов запроса понадобится злоумышленнику, чтобы обход защиты стал вероятным. Это поможет устанавливать реалистичные ограничения на число запросов к общедоступным API и решать, насколько тщательно отслеживать подозрительные шаблоны.

Работа также ставит под сомнение более ранние утверждения о том, что вероятность успеха атаки подчиняется простой степенной зависимости от N. Более сложная кривая, которая зависит от температуры, указывает на то, что при разработке защит нужно учитывать несколько факторов, а не только число попыток.

## Факты

- Статья опубликована на arXiv 29 сентября 2026 года.
- Марко Бироли указан как единственный автор исследования.
- Модель описывает данные пяти разных языковых моделей всего с помощью четырёх параметров, связанных с безопасностью.
- Она позволяет экстраполировать вероятность успеха атак с N ≤ 100 до N = 10⁴ вариантов запроса.
- Авторы установили, что показатель степени в зависимости вероятности успеха от числа вариантов N меняется, что противоречит предположению о простой степенной зависимости.

## Почему это важно

Модель даёт разработчикам ИИ простой способ оценить, насколько сложно злоумышленникам обходить защитные механизмы. Это может помочь определить ограничения для API и настроить инструменты мониторинга. Кроме того, она показывает, что ориентация на один показатель — например, число попыток — может не учитывать другие факторы, облегчающие обход защиты.

## Источники и ссылки

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Обновлено: 2026-09-29
