OossaИИ быстро развивается. Мы объясняем это просто.
Рассылка

· 1 мин чтения

Новая модель предсказывает, как успех атак с обходом защиты ИИ зависит от числа попыток

Исследователи во главе с Марко Бироли 29 сентября 2026 года опубликовали статью с простой формулой для оценки того, как часто удаются попытки обойти защиту ИИ при увеличении числа запросов.

Oossa · О проекте Oossa

Новая модель предсказывает, как успех атак с обходом защиты ИИ зависит от числа попыток
Photo by FlyD on Unsplash

29 сентября 2026 года специалист по информатике Марко Бироли опубликовал на arXiv статью «Escaping Alignment: A Physical Trap Model of Best‑of‑N Jailbreaking». В ней представлена простая «модель барьера», объясняющая, как меняется вероятность успеха атак с обходом защиты, когда злоумышленник увеличивает два параметра: число вариантов запроса (N) и число ответов на каждый вариант (M). Модель использует всего четыре числа, связанные с механизмами безопасности, и при этом позволяет предсказывать результаты атак гораздо большего масштаба, чем проверяли до сих пор.

Что делает новая модель?

Модель предполагает, что у каждого запроса есть исходный уровень безопасности, а затем добавляет случайный «барьер», который можно преодолеть, если злоумышленник попробует достаточно вариантов. Подобрав значения четырёх параметров по данным пяти разных языковых моделей, автор показывает, что результаты всех пяти ложатся на одну и ту же кривую масштабирования. Это позволяет экстраполировать результаты экспериментов с числом вариантов запроса до 100 на сценарии с 10 000 вариантами — то, что предыдущие исследования не могли надёжно сделать.

В статье также рассматривается, как на успех атаки влияет температура генерации — параметр, управляющий случайностью ответов ИИ. С помощью тех же четырёх чисел авторы могут предсказывать вероятность успеха при температурах, которые не проверяли.

Почему это важно для безопасности ИИ

Если предсказания модели подтвердятся, инженеры по безопасности смогут оценить, сколько вариантов запроса понадобится злоумышленнику, чтобы обход защиты стал вероятным. Это поможет устанавливать реалистичные ограничения на число запросов к общедоступным API и решать, насколько тщательно отслеживать подозрительные шаблоны.

Работа также ставит под сомнение более ранние утверждения о том, что вероятность успеха атаки подчиняется простой степенной зависимости от N. Более сложная кривая, которая зависит от температуры, указывает на то, что при разработке защит нужно учитывать несколько факторов, а не только число попыток.

Почему это важно

Модель даёт разработчикам ИИ простой способ оценить, насколько сложно злоумышленникам обходить защитные механизмы. Это может помочь определить ограничения для API и настроить инструменты мониторинга. Кроме того, она показывает, что ориентация на один показатель — например, число попыток — может не учитывать другие факторы, облегчающие обход защиты.

Эта статья была полезной?

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 сент. 2026 г.arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 источников

Обновлено:

Oossallms.txt.md

Поделиться

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Новая модель предсказывает, как успех атак с обходом защиты ИИ зависит от числа попыток – Oossa