Cloudflareは、大規模AIモデルに同社のWeb Application Firewall(WAF)を突破させる実験を行った。モデルは、ファイアウォールがすでに遮断していたペイロードを起点に、過去の試行への応答を踏まえて、エンコードや配置、送信方法を変えながら改変した。検証はブラックボックス方式で、モデルがCloudflareのルールセットや内部シグナルを見ることはなかった。
検証で得られた結果
Python製のハーネスが検証を制御した。HTTPリクエストの作成や状態管理、制限の適用、応答の収集を担い、AIは次の改変案を提示して結果を評価した。45のシナリオで、システムは1,107回の改変を試みた。人間による選別の結果、49件がさらに調査する価値のあるものと判断され、そのうち48件はコマンドインジェクションまたはサーバーサイドリクエストフォージェリ(SSRF)に関するものだった。この検証を受け、CloudflareのManaged Rulesetに3件の変更が加わった。新たな検知ルール「SSRF – Obfuscated Host」と「SSRF – Restricted Protocol」の2件に加え、既存の「SSRF – Cloud」ルールが改善された。
他の取り組みとの共通点
Cloudflareの仕組みは、ほかのセキュリティ向けハーネスにも通じる。GoogleのMandiant Agentic Vulnerability Discovery Harnessは、コード解析、仮説の生成、検証を専門とするエージェントを連携させる。OpenAIのCodex SecurityやGoogleのPageBreakもモデルを組み込んでいるが、実行範囲を厳しく制限し、修正を適用する前に人間が確認する仕組みを採用している。
なぜ重要か
Cloudflareを利用するウェブサイト運営者にとって、AIを使った検証により、これまですり抜けていた巧妙なSSRF攻撃の一部をファイアウォールが新たに遮断できるようになった。ルールセットを公開せずに、モデルを活用した自動検証で微妙な攻撃パターンを見つけられることを示す事例だ。ただし、最終判断は人間の分析担当者が行うため、新たな保護策の導入ペースはレビューの処理能力に左右される可能性がある。