Anthropicの社内レッドチームは2026年9月29日、同社のFrontierテストの概要を公表した。チームは最新モデルのGLM‑5.3とClaude Mythos Previewを使い、ランダムに選んだバイナリー悪用の課題100件に取り組ませた。GLM‑5.3は試行の4%で制御フローの完全な乗っ取りに成功し、Claude Mythos Previewの成功率は6%だった。同じテストで、Claude Opus 4.6やGLM‑5.2などの旧バージョンは、乗っ取りを一度も達成できなかった。
数値が示すもの
制御フローの乗っ取りとは、攻撃者が選んだコードを実行するようプログラムをだますことだ。セキュリティの分野では、システムを乗っ取る古典的な手法にあたる。少数の試行とはいえ、これらのモデルがこうした攻撃を実現できることは、実用的な攻撃用コードを生成できるだけの低レベルコードへの理解を身につけたことを示している。レッドチームによると、同社のモデルがこの水準に達したのは今回が初めてだ。
日常のユーザーにとっての意味
バイナリー悪用のテストを目にする人はほとんどいないだろう。しかし今回の結果は、将来のAIアシスタントが、悪用された場合により強力で危険になり得るスクリプトを書く可能性を示している。また、セキュリティチームはAIが生成したコードを、人間が書いたコードと同じように慎重に扱う必要がある。現時点でこの能力は限られており、成功するのは数%のケースにすぎないが、安全対策に取り組むべき新たな領域が浮かび上がった。
なぜ重要か
今回の結果は、最新の言語モデルがプログラムの実行権を実際に奪うコードを生成できることを示している。Anthropicのモデルでこの能力が確認されたのは初めてだ。成功率はまだ低いものの、AIツールでソフトウェアを書いたりレビューしたりする際には、より強固な安全対策が必要になることを示唆している。