OossaL'IA évolue vite. Nous l'expliquons simplement.

Un test d’Anthropic révèle que de nouveaux modèles peuvent détourner l’exécution du code

Des tests en équipe rouge montrent que GLM‑5.3 et Claude Mythos Preview réussissent à détourner le flux d’exécution dans une faible proportion des cas, dépassant ainsi les modèles précédents.

Oossa1 min de lecture

Un test d’Anthropic révèle que de nouveaux modèles peuvent détourner l’exécution du code
Photo by Mohammad Rahmani on Unsplash

L’équipe interne d’Anthropic chargée des tests en équipe rouge a publié un bref compte rendu de son essai Frontier le 29 septembre 2026. Elle a soumis 100 défis aléatoires d’exploitation binaire à deux de ses modèles les plus récents, GLM‑5.3 et Claude Mythos Preview. GLM‑5.3 a réussi à détourner complètement le flux d’exécution dans 4 % des tentatives, contre 6 % pour Claude Mythos Preview. Les versions précédentes, comme Claude Opus 4.6 et GLM‑5.2, n’ont réussi aucun détournement lors du même test.

Ce que signifient ces chiffres

Un détournement du flux d’exécution consiste à piéger un programme pour qu’il exécute le code choisi par un attaquant. En sécurité informatique, c’est une méthode classique pour prendre le contrôle d’un système. Le fait que ces modèles puissent produire de tels exploits lors de quelques essais montre qu’ils ont suffisamment appris le fonctionnement du code de bas niveau pour générer des charges utiles d’attaque opérationnelles. Selon l’équipe rouge, c’est la première fois qu’un de ses modèles franchit ce seuil.

Pourquoi cela concerne les utilisateurs

La plupart des gens ne seront jamais confrontés à un test d’exploitation binaire, mais ce résultat laisse entrevoir que les futurs assistants d’IA pourraient écrire des scripts plus puissants et potentiellement dangereux s’ils sont utilisés à mauvais escient. Il signifie aussi que les équipes de sécurité devront traiter le code généré par l’IA avec autant de prudence que celui écrit par des humains. Pour l’instant, cette capacité reste limitée — elle n’apparaît que dans quelques pour cent des cas —, mais elle ouvre un nouveau champ de travail en matière de sécurité.

Pourquoi c'est important

Ces résultats montrent que les modèles de langage modernes peuvent générer du code capable de prendre effectivement le contrôle de programmes, une capacité encore jamais observée dans les modèles d’Anthropic. Ils soulignent la nécessité de renforcer les garde-fous lors de l’utilisation d’outils d’IA pour écrire ou examiner des logiciels, même si le taux de réussite reste faible.

Cet article vous a-t-il été utile ?
Partager

À lire ensuite

Oossa · Newsletter

La semaine de l'IA, expliquée

Chaque lundi : l'essentiel de l'actualité, en langage clair. Gratuit, sans spam.

Sources et références

#SourceMédiaDateÀ retenir
1Quoting Anthropic Frontier Red Team ↗Simon Willison29 sept. 2026<blockquote cite="https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities"><p>We evaluate several models on

1 sources

Dernière mise à jour: ·Markdown·llms.txt