Внутренняя red-team-команда Anthropic опубликовала краткий отчет о тестировании Frontier 29 сентября 2026 года. Команда проверила две новейшие модели — GLM‑5.3 и Claude Mythos Preview — на 100 случайно выбранных заданиях по эксплуатации бинарных уязвимостей. GLM‑5.3 удалось полностью перехватить управление потоком выполнения в 4 % попыток, а Claude Mythos Preview — в 6 %. Предыдущие версии, в том числе Claude Opus 4.6 и GLM‑5.2, в том же тесте не смогли перехватить управление ни разу.
Что означают эти цифры
Перехват управления потоком выполнения — это ситуация, когда программу заставляют исполнять код, выбранный злоумышленником. В сфере кибербезопасности это классический способ захватить контроль над системой. То, что модели смогли создать такие эксплойты в нескольких испытаниях, показывает: они уже достаточно хорошо освоили низкоуровневый код, чтобы генерировать работающие вредоносные нагрузки. По словам red-team-команды, модели Anthropic впервые достигли такого уровня.
Почему это важно для обычных пользователей
Большинство людей никогда не столкнется с тестом на эксплуатацию бинарных уязвимостей, однако результаты указывают на то, что будущие ИИ-помощники смогут писать более мощные и потенциально опасные скрипты, если их использовать во вред. Это также означает, что специалистам по безопасности придется относиться к коду, созданному ИИ, с той же осторожностью, что и к коду, написанному людьми. Пока эта возможность ограничена — она проявляется лишь в нескольких процентах случаев, — но она открывает новое направление для работы над безопасностью.
Почему это важно
Эти результаты показывают, что современные языковые модели способны создавать код, который действительно захватывает управление программами. Раньше модели Anthropic такой способности не демонстрировали. Это указывает на необходимость усилить меры предосторожности при использовании ИИ-инструментов для написания и проверки программного обеспечения, хотя доля успешных попыток пока невелика.