· 1 мин чтения
Новая модель предсказывает, как успех атак с обходом защиты ИИ зависит от числа попыток
Исследователи во главе с Марко Бироли 29 сентября 2026 года опубликовали статью с простой формулой для оценки того, как часто удаются попытки обойти защиту ИИ при увеличении числа запросов.
Oossa · О проекте Oossa
29 сентября 2026 года специалист по информатике Марко Бироли опубликовал на arXiv статью «Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking». В ней представлена простая «модель барьера», объясняющая, как меняется вероятность успеха атак с обходом защиты, когда злоумышленник увеличивает два параметра: число вариантов запроса (N) и число ответов на каждый вариант (M). Модель использует всего четыре числа, связанные с механизмами безопасности, и при этом позволяет предсказывать результаты атак гораздо большего масштаба, чем проверяли до сих пор.
Что делает новая модель?
Модель предполагает, что у каждого запроса есть исходный уровень безопасности, а затем добавляет случайный «барьер», который можно преодолеть, если злоумышленник попробует достаточно вариантов. Подобрав значения четырёх параметров по данным пяти разных языковых моделей, автор показывает, что результаты всех пяти ложатся на одну и ту же кривую масштабирования. Это позволяет экстраполировать результаты экспериментов с числом вариантов запроса до 100 на сценарии с 10 000 вариантами — то, что предыдущие исследования не могли надёжно сделать.
В статье также рассматривается, как на успех атаки влияет температура генерации — параметр, управляющий случайностью ответов ИИ. С помощью тех же четырёх чисел авторы могут предсказывать вероятность успеха при температурах, которые не проверяли.
Почему это важно для безопасности ИИ
Если предсказания модели подтвердятся, инженеры по безопасности смогут оценить, сколько вариантов запроса понадобится злоумышленнику, чтобы обход защиты стал вероятным. Это поможет устанавливать реалистичные ограничения на число запросов к общедоступным API и решать, насколько тщательно отслеживать подозрительные шаблоны.
Работа также ставит под сомнение более ранние утверждения о том, что вероятность успеха атаки подчиняется простой степенной зависимости от N. Более сложная кривая, которая зависит от температуры, указывает на то, что при разработке защит нужно учитывать несколько факторов, а не только число попыток.
Почему это важно
Модель даёт разработчикам ИИ простой способ оценить, насколько сложно злоумышленникам обходить защитные механизмы. Это может помочь определить ограничения для API и настроить инструменты мониторинга. Кроме того, она показывает, что ориентация на один показатель — например, число попыток — может не учитывать другие факторы, облегчающие обход защиты.
Источники и ссылки
| # | Источник | Издание | Дата | Главное |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 29 сент. 2026 г. | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 источников
Обновлено:
Oossa · Рассылка
Неделя ИИ — простыми словами
Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.