# Un nuevo modelo predice cómo escalan los ataques de jailbreak con el esfuerzo

> Un equipo de investigadores encabezado por Marco Biroli publicó el 29 de septiembre de 2026 un artículo que propone una fórmula sencilla para estimar con qué frecuencia tienen éxito los intentos de jailbreak a medida que los atacantes prueban más prompts.

Oossa · 2026-09-29 · https://oossa.com/es/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

El 29 de septiembre de 2026, el informático Marco Biroli publicó en arXiv un artículo titulado «Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking». El trabajo presenta un «modelo de barrera» sencillo que explica cómo cambia la tasa de éxito de los ataques de jailbreak cuando un atacante aumenta dos variables: la cantidad de variantes de prompts (N) y la cantidad de respuestas por variante (M). El modelo utiliza apenas cuatro cifras relacionadas con los mecanismos de seguridad, pero puede predecir resultados de ataques mucho mayores que los que se han probado hasta ahora.

## ¿Qué hace el nuevo modelo?

El modelo asigna a cada prompt un nivel de seguridad de base y luego añade una «barrera» aleatoria que puede superarse si el atacante prueba suficientes variantes. Al ajustar las cuatro cifras a datos de cinco modelos de lenguaje distintos, los autores muestran que los cinco siguen la misma curva de escalamiento. Esto les permite extrapolar de experimentos con hasta 100 variantes de prompts a escenarios con 10 000, algo que estudios anteriores no podían hacer de forma fiable.

El artículo también analiza cómo influye en el éxito de los ataques la temperatura de generación, un parámetro que controla la aleatoriedad de las respuestas de la IA. Con las mismas cuatro cifras, los autores pueden predecir las tasas de éxito a temperaturas que nunca probaron.

## Por qué importa para la seguridad de la IA

Si las predicciones del modelo se confirman, los ingenieros de seguridad podrán estimar cuántas variantes de prompts necesitaría probar un atacante para que un jailbreak se vuelva probable. Eso les ayudará a establecer límites realistas para la cantidad de prompts permitida en las API públicas y a decidir con qué intensidad vigilar patrones sospechosos.

El trabajo también pone en duda afirmaciones anteriores de que el éxito de los ataques sigue una relación de ley de potencia sencilla con N. Al mostrar una curva más compleja que depende de la temperatura, sugiere que las defensas deben tener en cuenta varios factores, no solo el número de intentos.

## Los hechos

- El artículo se publicó en arXiv el 29 de septiembre de 2026.
- Marco Biroli figura como único autor del estudio.
- El modelo ajusta datos de cinco modelos de lenguaje distintos utilizando solo cuatro parámetros relacionados con la seguridad.
- Puede extrapolar las tasas de éxito de los ataques desde N ≤ 100 hasta N = 10⁴ variantes de prompts.
- Los autores concluyen que el exponente de la tasa de éxito cambia con N, lo que contradice la hipótesis de una ley de potencia sencilla.

## Por qué importa

El modelo ofrece a los desarrolladores de IA una forma rápida de calcular lo difícil que es para los atacantes burlar las barreras de seguridad, lo que puede orientar los límites de las API y las herramientas de supervisión. También advierte que centrarse en una sola métrica, como el número de intentos, puede dejar fuera otros factores que facilitan los jailbreaks.

## Fuentes y referencias

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Última actualización: 2026-09-29
