Cloudflare провела эксперимент: большие языковые модели пытались обойти её межсетевой экран для веб-приложений (WAF). Модели брали за основу запросы, которые экран уже блокировал, а затем меняли их — например, кодировку, расположение полезной нагрузки или способ её передачи — с учётом реакции на предыдущие попытки. Проверка была «чёрным ящиком»: моделям не показывали набор правил Cloudflare и внутренние сигналы системы.
Результаты тестирования
Тестом управлял сценарий на Python: он формировал HTTP-запросы, сохранял состояние, задавал ограничения и собирал ответы. ИИ предлагал следующий вариант атаки и оценивал результат. В ходе 45 сценариев система сгенерировала 1 107 попыток модификации запросов. После проверки специалистами 49 находок признали заслуживающими дальнейшей проработки; 48 из них касались внедрения команд или подделки серверных запросов (SSRF). По итогам тестирования в Managed Ruleset Cloudflare внесли три изменения: добавили два новых правила обнаружения — SSRF – Obfuscated Host и SSRF – Restricted Protocol — и улучшили существующее правило SSRF – Cloud.
Как этот подход применяют в других проектах
Подход Cloudflare похож на другие инструменты для тестирования безопасности. Mandiant Agentic Vulnerability Discovery Harness от Google объединяет специализированных ИИ-агентов для анализа кода, выдвижения гипотез и их проверки. Codex Security от OpenAI и PageBreak от Google тоже используют модели в цикле тестирования, но жёстко ограничивают выполнение и требуют проверки человеком до применения исправлений.
Почему это важно
Для владельцев сайтов, использующих Cloudflare, это означает, что WAF теперь блокирует ещё несколько хитро замаскированных вариантов SSRF-атак, которые раньше могли проходить. Эксперимент показывает, что автоматизированное тестирование с участием моделей помогает выявлять сложные вариации атак, не раскрывая внутренние правила защиты. При этом окончательное решение по-прежнему принимают специалисты, поэтому скорость появления новых средств защиты может зависеть от их загрузки.