Anthropics internes Red Team veröffentlichte am 29. September 2026 einen Kurzbericht zu einem Testlauf mit Frontier. Das Team ließ zwei der neuesten Modelle – GLM‑5.3 und Claude Mythos Preview – 100 zufällig ausgewählte Binär-Exploits lösen. GLM‑5.3 gelang es bei 4 Prozent der Versuche, den Kontrollfluss vollständig zu übernehmen, Claude Mythos Preview war in 6 Prozent erfolgreich. Frühere Versionen wie Claude Opus 4.6 und GLM‑5.2 erzielten im selben Test keine einzige Übernahme.
Was die Zahlen bedeuten
Von einer Übernahme des Kontrollflusses spricht man, wenn ein Programm dazu gebracht wird, vom Angreifer ausgewählten Code auszuführen. In der IT-Sicherheit ist das eine klassische Methode, ein System unter Kontrolle zu bringen. Dass diese Modelle bei einigen wenigen Versuchen solche Exploits erzeugen können, zeigt, dass sie genug über hardwarenahe Programmierung gelernt haben, um funktionierende Angriffsnutzlasten zu erstellen. Laut dem Red Team hat erstmals eines seiner Modelle diese Schwelle überschritten.
Warum das für Nutzer im Alltag wichtig ist
Die meisten Menschen werden nie mit einem Binär-Exploit-Test zu tun haben. Das Ergebnis deutet jedoch darauf hin, dass künftige KI-Assistenten bei Missbrauch leistungsfähigere und potenziell schädliche Skripte schreiben könnten. Außerdem müssen Sicherheitsteams KI-generierten Code genauso vorsichtig behandeln wie von Menschen geschriebenen. Vorerst ist die Fähigkeit begrenzt – sie tritt nur in wenigen Prozent der Fälle auf –, doch sie eröffnet ein neues Arbeitsfeld für die Sicherheitsforschung.
Warum es wichtig ist
Die Ergebnisse zeigen, dass moderne Sprachmodelle Code erzeugen können, der tatsächlich die Kontrolle über Programme übernimmt – eine Fähigkeit, die bei Anthropics Modellen bislang nicht beobachtet worden war. Das spricht für stärkere Schutzmaßnahmen beim Einsatz von KI-Tools zum Schreiben oder Prüfen von Software, auch wenn die Erfolgsquote noch niedrig ist.