OossaLa IA avanza rápido. Te lo explicamos de forma sencilla.

Prueba de Anthropic revela secuestros del flujo de ejecución

Las pruebas de red team hallaron que GLM‑5.3 y Claude Mythos Preview logran secuestrar el flujo de ejecución en una pequeña proporción de las tareas, un avance respecto de modelos anteriores.

Oossa1 min de lectura

Prueba de Anthropic revela secuestros del flujo de ejecución
Photo by Mohammad Rahmani on Unsplash

El equipo interno de red team de Anthropic publicó el 29 de septiembre de 2026 un informe sobre una prueba de Frontier. El equipo sometió a dos de sus modelos más recientes —GLM‑5.3 y Claude Mythos Preview— a 100 desafíos aleatorios de explotación de binarios. GLM‑5.3 logró secuestrar por completo el flujo de ejecución en el 4 % de los intentos, mientras que Claude Mythos Preview lo consiguió en el 6 %. Versiones anteriores, como Claude Opus 4.6 y GLM‑5.2, no lograron ningún secuestro en la misma prueba.

Qué significan las cifras

Un secuestro del flujo de ejecución ocurre cuando se engaña a un programa para que ejecute código elegido por un atacante. En términos de seguridad, es una forma clásica de tomar el control de un sistema. Que estos modelos puedan generar exploits de este tipo en algunos intentos demuestra que han aprendido lo suficiente sobre código de bajo nivel como para crear cargas maliciosas funcionales. El equipo de red team afirma que es la primera vez que alguno de sus modelos supera ese umbral.

Por qué les importa a los usuarios

La mayoría de la gente nunca se enfrentará a una prueba de explotación de binarios, pero el resultado apunta a que los futuros asistentes de IA podrían escribir scripts más potentes y potencialmente dañinos si se usan de forma indebida. También significa que los equipos de seguridad tendrán que tratar el código generado por IA con la misma cautela que el escrito por personas. Por ahora, esta capacidad es limitada —aparece en apenas unos pocos puntos porcentuales de los casos—, pero señala una nueva área de trabajo en seguridad.

Por qué importa

Estos hallazgos muestran que los modelos de lenguaje actuales pueden generar código que toma el control de programas, una capacidad que no se había observado antes en los modelos de Anthropic. Esto apunta a la necesidad de reforzar las medidas de seguridad al usar herramientas de IA para escribir o revisar software, aunque la tasa de éxito siga siendo baja.

¿Te resultó útil este artículo?
Compartir

Sigue leyendo

Oossa · Boletín

La semana en IA, explicada

Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.

Fuentes y referencias

#FuenteMedioFechaIdea clave
1Quoting Anthropic Frontier Red Team ↗Simon Willison29 sept 2026<blockquote cite="https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities"><p>We evaluate several models on

1 fuentes

Última actualización: ·Markdown·llms.txt