· 1 min de lectura
Un nuevo modelo predice cómo escalan los ataques de jailbreak con el esfuerzo
Un equipo de investigadores encabezado por Marco Biroli publicó el 29 de septiembre de 2026 un artículo que propone una fórmula sencilla para estimar con qué frecuencia tienen éxito los intentos de jailbreak a medida que los atacantes prueban más prompts.
Oossa · Acerca de Oossa
El 29 de septiembre de 2026, el informático Marco Biroli publicó en arXiv un artículo titulado «Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking». El trabajo presenta un «modelo de barrera» sencillo que explica cómo cambia la tasa de éxito de los ataques de jailbreak cuando un atacante aumenta dos variables: la cantidad de variantes de prompts (N) y la cantidad de respuestas por variante (M). El modelo utiliza apenas cuatro cifras relacionadas con los mecanismos de seguridad, pero puede predecir resultados de ataques mucho mayores que los que se han probado hasta ahora.
¿Qué hace el nuevo modelo?
El modelo asigna a cada prompt un nivel de seguridad de base y luego añade una «barrera» aleatoria que puede superarse si el atacante prueba suficientes variantes. Al ajustar las cuatro cifras a datos de cinco modelos de lenguaje distintos, los autores muestran que los cinco siguen la misma curva de escalamiento. Esto les permite extrapolar de experimentos con hasta 100 variantes de prompts a escenarios con 10 000, algo que estudios anteriores no podían hacer de forma fiable.
El artículo también analiza cómo influye en el éxito de los ataques la temperatura de generación, un parámetro que controla la aleatoriedad de las respuestas de la IA. Con las mismas cuatro cifras, los autores pueden predecir las tasas de éxito a temperaturas que nunca probaron.
Por qué importa para la seguridad de la IA
Si las predicciones del modelo se confirman, los ingenieros de seguridad podrán estimar cuántas variantes de prompts necesitaría probar un atacante para que un jailbreak se vuelva probable. Eso les ayudará a establecer límites realistas para la cantidad de prompts permitida en las API públicas y a decidir con qué intensidad vigilar patrones sospechosos.
El trabajo también pone en duda afirmaciones anteriores de que el éxito de los ataques sigue una relación de ley de potencia sencilla con N. Al mostrar una curva más compleja que depende de la temperatura, sugiere que las defensas deben tener en cuenta varios factores, no solo el número de intentos.
Por qué importa
El modelo ofrece a los desarrolladores de IA una forma rápida de calcular lo difícil que es para los atacantes burlar las barreras de seguridad, lo que puede orientar los límites de las API y las herramientas de supervisión. También advierte que centrarse en una sola métrica, como el número de intentos, puede dejar fuera otros factores que facilitan los jailbreaks.
Fuentes y referencias
| # | Fuente | Medio | Fecha | Idea clave |
|---|---|---|---|---|
| 1 | Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗ | arXiv | 29 sept 2026 | arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ |
1 fuentes
Última actualización:
Oossa · Boletín
La semana en IA, explicada
Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.