Il red team interno di Anthropic ha pubblicato il 29 settembre 2026 un breve resoconto di un test Frontier. Il team ha sottoposto 100 sfide casuali di binary exploitation a due dei suoi modelli più recenti: GLM‑5.3 e Claude Mythos Preview. GLM‑5.3 è riuscito a dirottare completamente il flusso di esecuzione nel 4% dei tentativi, mentre Claude Mythos Preview ha avuto successo nel 6%. Le versioni precedenti, come Claude Opus 4.6 e GLM‑5.2, non sono riuscite a effettuare alcun dirottamento nello stesso test.
Cosa significano questi numeri
Si parla di dirottamento del flusso di esecuzione quando un programma viene indotto a eseguire codice scelto dall’attaccante. In termini di sicurezza, è un metodo classico per prendere il controllo di un sistema. Il fatto che questi modelli riescano a creare exploit di questo tipo in una manciata di prove mostra che hanno appreso abbastanza sul codice a basso livello da generare payload d’attacco funzionanti. Secondo il red team, è la prima volta che uno dei suoi modelli supera questa soglia.
Perché interessa agli utenti comuni
La maggior parte delle persone non si troverà mai ad affrontare un test di binary exploitation, ma il risultato suggerisce che i futuri assistenti IA potrebbero scrivere script più potenti e potenzialmente dannosi, se usati impropriamente. Significa anche che i team di sicurezza dovranno trattare il codice generato dall’IA con la stessa cautela riservata a quello scritto dalle persone. Per ora, la capacità è limitata — emerge solo in una piccola percentuale di casi — ma indica un nuovo ambito su cui concentrarsi per la sicurezza.
Perché conta
Questi risultati mostrano che i moderni modelli linguistici possono generare codice capace di prendere effettivamente il controllo dei programmi, una capacità mai osservata prima nei modelli di Anthropic. Indicano la necessità di protezioni più solide quando si usano strumenti di IA per scrivere o esaminare software, anche se la percentuale di successo è ancora bassa.