Anthropic’s interne red team publiceerde op 29 september 2026 een korte toelichting op de Frontier-test. Het team voerde 100 willekeurige uitdagingen op het gebied van binaire exploitatie uit met twee van de nieuwste modellen: GLM‑5.3 en Claude Mythos Preview. GLM‑5.3 wist bij 4 procent van de pogingen de besturingsstroom volledig over te nemen; bij Claude Mythos Preview lukte dat in 6 procent van de gevallen. Eerdere versies, zoals Claude Opus 4.6 en GLM‑5.2, slaagden er in dezelfde test niet in de besturing over te nemen.
Wat de cijfers betekenen
Bij een overname van de besturingsstroom wordt een programma misleid om code uit te voeren die de aanvaller heeft gekozen. In beveiligingstermen is dit een klassieke manier om de controle over een systeem te krijgen. Dat deze modellen bij een handvol tests zulke exploits kunnen maken, laat zien dat ze genoeg kennis van low-levelcode hebben opgedaan om bruikbare aanvalscode te genereren. Volgens het red team is dit de eerste keer dat een van hun modellen die grens heeft overschreden.
Waarom dit belangrijk is voor gewone gebruikers
De meeste mensen krijgen nooit met een test op binaire exploitatie te maken, maar het resultaat wijst erop dat toekomstige AI-assistenten krachtigere, mogelijk schadelijke scripts kunnen schrijven als ze verkeerd worden gebruikt. Het betekent ook dat beveiligingsteams AI-gegenereerde code met dezelfde voorzichtigheid moeten behandelen als code die door mensen is geschreven. Voorlopig is deze vaardigheid beperkt — ze komt in slechts enkele procenten van de gevallen voor — maar ze markeert een nieuw terrein voor veiligheidswerk.
Waarom het ertoe doet
Deze bevindingen laten zien dat moderne taalmodellen code kunnen genereren waarmee ze daadwerkelijk de controle over programma’s overnemen — een vaardigheid die Anthropic’s modellen eerder niet hadden laten zien. Dat wijst op de noodzaak van sterkere waarborgen wanneer AI-tools worden gebruikt om software te schrijven of te beoordelen, ook al is het slagingspercentage nog laag.