OossaL'IA evolve in fretta. Noi la spieghiamo in modo semplice.

Test Anthropic Frontier: i nuovi modelli possono dirottare l’esecuzione del codice

I test red team hanno rilevato che GLM‑5.3 e Claude Mythos Preview riescono a dirottare il flusso di esecuzione in una piccola percentuale di casi, superando i modelli precedenti.

Oossa1 min di lettura

Test Anthropic Frontier: i nuovi modelli possono dirottare l’esecuzione del codice
Photo by Mohammad Rahmani on Unsplash

Il red team interno di Anthropic ha pubblicato il 29 settembre 2026 un breve resoconto di un test Frontier. Il team ha sottoposto 100 sfide casuali di binary exploitation a due dei suoi modelli più recenti: GLM‑5.3 e Claude Mythos Preview. GLM‑5.3 è riuscito a dirottare completamente il flusso di esecuzione nel 4% dei tentativi, mentre Claude Mythos Preview ha avuto successo nel 6%. Le versioni precedenti, come Claude Opus 4.6 e GLM‑5.2, non sono riuscite a effettuare alcun dirottamento nello stesso test.

Cosa significano questi numeri

Si parla di dirottamento del flusso di esecuzione quando un programma viene indotto a eseguire codice scelto dall’attaccante. In termini di sicurezza, è un metodo classico per prendere il controllo di un sistema. Il fatto che questi modelli riescano a creare exploit di questo tipo in una manciata di prove mostra che hanno appreso abbastanza sul codice a basso livello da generare payload d’attacco funzionanti. Secondo il red team, è la prima volta che uno dei suoi modelli supera questa soglia.

Perché interessa agli utenti comuni

La maggior parte delle persone non si troverà mai ad affrontare un test di binary exploitation, ma il risultato suggerisce che i futuri assistenti IA potrebbero scrivere script più potenti e potenzialmente dannosi, se usati impropriamente. Significa anche che i team di sicurezza dovranno trattare il codice generato dall’IA con la stessa cautela riservata a quello scritto dalle persone. Per ora, la capacità è limitata — emerge solo in una piccola percentuale di casi — ma indica un nuovo ambito su cui concentrarsi per la sicurezza.

Perché conta

Questi risultati mostrano che i moderni modelli linguistici possono generare codice capace di prendere effettivamente il controllo dei programmi, una capacità mai osservata prima nei modelli di Anthropic. Indicano la necessità di protezioni più solide quando si usano strumenti di IA per scrivere o esaminare software, anche se la percentuale di successo è ancora bassa.

Questo articolo ti è stato utile?
Condividi

Leggi anche

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.

Fonti e riferimenti

#FonteTestataDataPunto chiave
1Quoting Anthropic Frontier Red Team ↗Simon Willison29 set 2026<blockquote cite="https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities"><p>We evaluate several models on

1 fonti

Ultimo aggiornamento: ·Markdown·llms.txt