OossaAIは急速に進化しています。私たちがわかりやすく解説します。

Anthropicのテスト、新モデルがコード実行を乗っ取る能力を確認

レッドチームのテストでは、GLM‑5.3とClaude Mythos Previewが一部の課題で制御フローの乗っ取りに成功。旧モデルを上回った。

Oossa1 分で読める

Anthropicのテスト、新モデルがコード実行を乗っ取る能力を確認
Photo by Mohammad Rahmani on Unsplash

Anthropicの社内レッドチームは2026年9月29日、同社のFrontierテストの概要を公表した。チームは最新モデルのGLM‑5.3とClaude Mythos Previewを使い、ランダムに選んだバイナリー悪用の課題100件に取り組ませた。GLM‑5.3は試行の4%で制御フローの完全な乗っ取りに成功し、Claude Mythos Previewの成功率は6%だった。同じテストで、Claude Opus 4.6やGLM‑5.2などの旧バージョンは、乗っ取りを一度も達成できなかった。

数値が示すもの

制御フローの乗っ取りとは、攻撃者が選んだコードを実行するようプログラムをだますことだ。セキュリティの分野では、システムを乗っ取る古典的な手法にあたる。少数の試行とはいえ、これらのモデルがこうした攻撃を実現できることは、実用的な攻撃用コードを生成できるだけの低レベルコードへの理解を身につけたことを示している。レッドチームによると、同社のモデルがこの水準に達したのは今回が初めてだ。

日常のユーザーにとっての意味

バイナリー悪用のテストを目にする人はほとんどいないだろう。しかし今回の結果は、将来のAIアシスタントが、悪用された場合により強力で危険になり得るスクリプトを書く可能性を示している。また、セキュリティチームはAIが生成したコードを、人間が書いたコードと同じように慎重に扱う必要がある。現時点でこの能力は限られており、成功するのは数%のケースにすぎないが、安全対策に取り組むべき新たな領域が浮かび上がった。

なぜ重要か

今回の結果は、最新の言語モデルがプログラムの実行権を実際に奪うコードを生成できることを示している。Anthropicのモデルでこの能力が確認されたのは初めてだ。成功率はまだ低いものの、AIツールでソフトウェアを書いたりレビューしたりする際には、より強固な安全対策が必要になることを示唆している。

この記事は役に立ちましたか?
共有

次に読む

Oossa · ニュースレター

今週のAIを、わかりやすく

毎週月曜日、知っておきたいニュースをやさしい言葉で。無料・スパムなし。

出典と参考資料

#出典媒体日付要点
1Quoting Anthropic Frontier Red Team ↗Simon Willison2026/09/29<blockquote cite="https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities"><p>We evaluate several models on

1 件の出典

最終更新: ·Markdown·llms.txt