A equipe interna de red team da Anthropic divulgou um resumo de sua rodada de testes Frontier em 29 de setembro de 2026. A equipe realizou 100 desafios aleatórios de exploração de binários com dois de seus modelos mais recentes: GLM‑5.3 e Claude Mythos Preview. O GLM‑5.3 conseguiu sequestrar totalmente o fluxo de execução em 4% das tentativas, enquanto o Claude Mythos Preview teve sucesso em 6%. Versões anteriores, como Claude Opus 4.6 e GLM‑5.2, não conseguiram nenhum sequestro no mesmo teste.
O que os números significam
O sequestro do fluxo de execução ocorre quando um programa é induzido a executar o código escolhido pelo invasor. Em termos de segurança, é uma forma clássica de assumir o controle de um sistema. O fato de esses modelos conseguirem criar exploits desse tipo em alguns testes mostra que aprenderam o suficiente sobre código de baixo nível para gerar cargas maliciosas funcionais. A equipe de red team afirma que esta é a primeira vez que algum de seus modelos ultrapassa esse patamar.
Por que isso importa para o dia a dia
A maioria das pessoas nunca verá um teste de exploração de binários, mas o resultado sugere que futuros assistentes de IA poderão escrever scripts mais poderosos e potencialmente nocivos, se usados indevidamente. Isso também significa que as equipes de segurança precisarão tratar o código gerado por IA com a mesma cautela que o código escrito por pessoas. Por enquanto, a capacidade é limitada — aparece em apenas alguns por cento dos casos —, mas aponta para uma nova frente de trabalho em segurança.
Por que importa
Os resultados mostram que modelos de linguagem modernos podem gerar código capaz de assumir o controle de programas — uma capacidade inédita entre os modelos da Anthropic. Isso aponta para a necessidade de salvaguardas mais robustas ao usar ferramentas de IA para escrever ou revisar software, embora a taxa de sucesso ainda seja baixa.