Anthropics interna red team publicerade en kort rapport om sin Frontier-testkörning den 29 september 2026. Teamet testade två av sina nyaste modeller – GLM‑5.3 och Claude Mythos Preview – på 100 slumpmässigt utvalda utmaningar inom binär exploatering. GLM‑5.3 lyckades kapa kontrollflödet helt i 4 procent av försöken, medan Claude Mythos Preview lyckades i 6 procent. Tidigare versioner, som Claude Opus 4.6 och GLM‑5.2, lyckades inte kapa kontrollflödet alls i samma test.
Vad siffrorna betyder
En kapning av kontrollflödet innebär att ett program luras att köra kod som angriparen själv har valt. Inom datasäkerhet är det ett klassiskt sätt att ta över ett system. Att modellerna kan skapa sådana exploateringar i ett fåtal försök visar att de har lärt sig tillräckligt om lågnivåkod för att generera fungerande attackkod. Red teamet uppger att det är första gången någon av deras modeller har nått den nivån.
Varför det spelar roll för vanliga användare
De flesta kommer aldrig att stöta på ett test av binär exploatering, men resultatet antyder att framtida AI-assistenter skulle kunna skriva kraftfullare och potentiellt skadliga skript om de används på fel sätt. Det innebär också att säkerhetsteam måste vara lika försiktiga med AI-genererad kod som med kod skriven av människor. Förmågan är än så länge begränsad – den förekommer i bara några få procent av fallen – men visar att detta är ett nytt område där säkerhetsarbetet behöver stärkas.
Varför det spelar roll
Resultaten visar att moderna språkmodeller kan generera kod som faktiskt tar kontroll över program – en förmåga som inte tidigare har setts hos Anthropics modeller. Det tyder på att starkare skydd behövs när AI-verktyg används för att skriva eller granska programvara, även om andelen lyckade försök fortfarande är låg.