# Anthropic-test toont dat nieuwe modellen code-uitvoering kunnen kapen

> Uit red-teaming blijkt dat GLM‑5.3 en Claude Mythos Preview bij een klein deel van de tests de besturingsstroom wisten over te nemen — een stap verder dan eerdere modellen.

Oossa · 2026-09-29 · https://oossa.com/nl/anthropic-frontier-test-shows-new-models-can-hijack-code-execution

Anthropic’s interne red team publiceerde op 29 september 2026 een korte toelichting op de Frontier-test. Het team voerde 100 willekeurige uitdagingen op het gebied van binaire exploitatie uit met twee van de nieuwste modellen: GLM‑5.3 en Claude Mythos Preview. GLM‑5.3 wist bij 4 procent van de pogingen de besturingsstroom volledig over te nemen; bij Claude Mythos Preview lukte dat in 6 procent van de gevallen. Eerdere versies, zoals Claude Opus 4.6 en GLM‑5.2, slaagden er in dezelfde test niet in de besturing over te nemen.

## Wat de cijfers betekenen

Bij een overname van de besturingsstroom wordt een programma misleid om code uit te voeren die de aanvaller heeft gekozen. In beveiligingstermen is dit een klassieke manier om de controle over een systeem te krijgen. Dat deze modellen bij een handvol tests zulke exploits kunnen maken, laat zien dat ze genoeg kennis van low-levelcode hebben opgedaan om bruikbare aanvalscode te genereren. Volgens het red team is dit de eerste keer dat een van hun modellen die grens heeft overschreden.

## Waarom dit belangrijk is voor gewone gebruikers

De meeste mensen krijgen nooit met een test op binaire exploitatie te maken, maar het resultaat wijst erop dat toekomstige AI-assistenten krachtigere, mogelijk schadelijke scripts kunnen schrijven als ze verkeerd worden gebruikt. Het betekent ook dat beveiligingsteams AI-gegenereerde code met dezelfde voorzichtigheid moeten behandelen als code die door mensen is geschreven. Voorlopig is deze vaardigheid beperkt — ze komt in slechts enkele procenten van de gevallen voor — maar ze markeert een nieuw terrein voor veiligheidswerk.

## De feiten

- Het red team testte op 29 september 2026 100 willekeurige taken uit Anthropic’s interne benchmark voor binaire exploitatie.
- GLM‑5.3 slaagde erin bij 4 procent van de tests de besturingsstroom volledig over te nemen.
- Claude Mythos Preview slaagde erin bij 6 procent van de tests de besturingsstroom volledig over te nemen.
- Eerdere modellen, Claude Opus 4.6 en GLM‑5.2, wisten in dezelfde test de besturing niet over te nemen.

## Waarom het ertoe doet

Deze bevindingen laten zien dat moderne taalmodellen code kunnen genereren waarmee ze daadwerkelijk de controle over programma’s overnemen — een vaardigheid die Anthropic’s modellen eerder niet hadden laten zien. Dat wijst op de noodzaak van sterkere waarborgen wanneer AI-tools worden gebruikt om software te schrijven of te beoordelen, ook al is het slagingspercentage nog laag.

## Bronnen en referenties

1. [Quoting Anthropic Frontier Red Team](https://simonwillison.net/2026/Sep/29/anthropic-frontier-red-team/) – Simon Willison, 2026-09-29

Laatst bijgewerkt: 2026-09-29
