Cloudflare genomförde ett experiment där stora AI-modeller försökte ta sig förbi företagets webbapplikationsbrandvägg (WAF). Modellerna utgick från nyttolaster som brandväggen redan blockerade och modifierade dem – genom att ändra kodning, placering eller leveranssätt – utifrån hur tidigare försök hade hanterats. Testet genomfördes som en svart låda: modellerna fick aldrig se Cloudflares regeluppsättning eller interna signaler.
Resultatet av testet
En Python-baserad testmiljö samordnade försöket. Den skapade HTTP-förfrågningar, höll reda på tillstånd, satte gränser och samlade in svar, medan AI:n föreslog nästa modifiering och utvärderade resultatet. Under 45 scenarier genererade systemet 1 107 modifieringsförsök. Efter mänsklig granskning bedömdes 49 fynd vara värda att undersöka vidare, varav 48 gällde kommandoinjektion eller server-side request forgery (SSRF). Försöket ledde till tre ändringar i Cloudflares Managed Ruleset: två nya detektioner – SSRF – Obfuscated Host och SSRF – Restricted Protocol – samt en förbättring av den befintliga regeln SSRF – Cloud.
Hur metoden används på andra håll
Cloudflares upplägg liknar andra säkerhetsinriktade testmiljöer. Googles Mandiant Agentic Vulnerability Discovery Harness kopplar samman specialiserade agenter för kodanalys, hypotesgenerering och verifiering. Även OpenAI:s Codex Security och Googles PageBreak använder modeller i testprocessen, men begränsar körningen noggrant och kräver mänsklig granskning innan några åtgärder genomförs.
Varför det spelar roll
För webbplatsägare som använder Cloudflare innebär de AI-styrda testerna att brandväggen nu blockerar några fler svårupptäckta SSRF-varianter som tidigare slank igenom. Det visar att automatiserade tester med AI-stöd kan hitta subtila angreppsvarianter utan att avslöja den underliggande regeluppsättningen. Det slutliga beslutet ligger dock fortfarande hos mänskliga analytiker, så hur snabbt nya skydd införs kan bero på granskarnas kapacitet.