# Novo modelo prevê como ataques de jailbreak em IA escalam com o esforço

> Pesquisadores liderados por Marco Biroli divulgaram, em 29 de setembro de 2026, um artigo que apresenta uma fórmula simples para estimar a frequência com que tentativas de jailbreak são bem-sucedidas à medida que os atacantes experimentam mais prompts.

Oossa · 2026-09-29 · https://oossa.com/pt/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Em 29 de setembro de 2026, o cientista da computação Marco Biroli publicou no arXiv um artigo intitulado “Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking”. O trabalho apresenta um “modelo de barreira” simples, que explica como a taxa de sucesso dos ataques de jailbreak muda quando o atacante aumenta duas variáveis: o número de variações de prompt (N) e o número de respostas por variação (M). O modelo usa apenas quatro números relacionados a mecanismos de segurança, mas consegue prever resultados para ataques muito maiores do que os testados até agora.

## O que o novo modelo faz?

O modelo considera que cada prompt tem um nível básico de segurança e, em seguida, acrescenta uma “barreira” aleatória que pode ser superada se o atacante tentar variações suficientes. Ao ajustar os quatro números a dados de cinco modelos de linguagem diferentes, os autores mostram que os cinco convergem para a mesma curva de escala. Isso permite extrapolar experimentos com até 100 variações de prompt para cenários com 10 000 variações, algo que estudos anteriores não conseguiam fazer de forma confiável.

O artigo também analisa como a temperatura de geração — um controle que determina o grau de aleatoriedade nas respostas da IA — afeta o sucesso dos ataques. Com os mesmos quatro números, os autores conseguem prever as taxas de sucesso em temperaturas que nunca testaram.

## Por que isso importa para a segurança da IA

Se as previsões do modelo se confirmarem, engenheiros de segurança poderão estimar quantas variações de prompt um atacante precisaria experimentar para tornar provável um jailbreak. Isso os ajudará a estabelecer limites realistas para a quantidade de prompts permitida em APIs públicas e a decidir com que intensidade monitorar padrões suspeitos.

O trabalho também contesta afirmações anteriores de que o sucesso dos ataques segue uma relação simples de lei de potência com N. Ao mostrar uma curva mais complexa, que depende da temperatura, o estudo sugere que as defesas precisam levar em conta vários fatores, e não apenas o número de tentativas.

## Os fatos

- O artigo foi publicado no arXiv em 29 de setembro de 2026.
- Marco Biroli aparece como único autor do estudo.
- O modelo ajusta dados de cinco modelos de linguagem diferentes usando apenas quatro parâmetros relacionados à segurança.
- Ele consegue extrapolar taxas de sucesso de ataques de N ≤ 100 para N = 10⁴ variações de prompt.
- Os autores concluem que o expoente da taxa de sucesso muda com N, contrariando a hipótese de uma lei de potência simples.

## Por que importa

O modelo oferece aos desenvolvedores de IA uma maneira rápida de avaliar o grau de dificuldade que os atacantes enfrentam para contornar as proteções de segurança, o que pode orientar limites de API e ferramentas de monitoramento. Também alerta que confiar em uma única métrica, como o número de tentativas, pode deixar de fora outros fatores que facilitam os jailbreaks.

## Fontes e referências

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Última atualização: 2026-09-29
