El equipo interno de red team de Anthropic publicó el 29 de septiembre de 2026 un informe sobre una prueba de Frontier. El equipo sometió a dos de sus modelos más recientes —GLM‑5.3 y Claude Mythos Preview— a 100 desafíos aleatorios de explotación de binarios. GLM‑5.3 logró secuestrar por completo el flujo de ejecución en el 4 % de los intentos, mientras que Claude Mythos Preview lo consiguió en el 6 %. Versiones anteriores, como Claude Opus 4.6 y GLM‑5.2, no lograron ningún secuestro en la misma prueba.
Qué significan las cifras
Un secuestro del flujo de ejecución ocurre cuando se engaña a un programa para que ejecute código elegido por un atacante. En términos de seguridad, es una forma clásica de tomar el control de un sistema. Que estos modelos puedan generar exploits de este tipo en algunos intentos demuestra que han aprendido lo suficiente sobre código de bajo nivel como para crear cargas maliciosas funcionales. El equipo de red team afirma que es la primera vez que alguno de sus modelos supera ese umbral.
Por qué les importa a los usuarios
La mayoría de la gente nunca se enfrentará a una prueba de explotación de binarios, pero el resultado apunta a que los futuros asistentes de IA podrían escribir scripts más potentes y potencialmente dañinos si se usan de forma indebida. También significa que los equipos de seguridad tendrán que tratar el código generado por IA con la misma cautela que el escrito por personas. Por ahora, esta capacidad es limitada —aparece en apenas unos pocos puntos porcentuales de los casos—, pero señala una nueva área de trabajo en seguridad.
Por qué importa
Estos hallazgos muestran que los modelos de lenguaje actuales pueden generar código que toma el control de programas, una capacidad que no se había observado antes en los modelos de Anthropic. Esto apunta a la necesidad de reforzar las medidas de seguridad al usar herramientas de IA para escribir o revisar software, aunque la tasa de éxito siga siendo baja.