OossaA IA evolui rápido. Nós explicamos de forma simples.
Newsletter

· 1 min de leitura

Novo modelo prevê como ataques de jailbreak em IA escalam com o esforço

Pesquisadores liderados por Marco Biroli divulgaram, em 29 de setembro de 2026, um artigo que apresenta uma fórmula simples para estimar a frequência com que tentativas de jailbreak são bem-sucedidas à medida que os atacantes experimentam mais prompts.

Oossa · Sobre a Oossa

Novo modelo prevê como ataques de jailbreak em IA escalam com o esforço
Photo by FlyD on Unsplash

Em 29 de setembro de 2026, o cientista da computação Marco Biroli publicou no arXiv um artigo intitulado “Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking”. O trabalho apresenta um “modelo de barreira” simples, que explica como a taxa de sucesso dos ataques de jailbreak muda quando o atacante aumenta duas variáveis: o número de variações de prompt (N) e o número de respostas por variação (M). O modelo usa apenas quatro números relacionados a mecanismos de segurança, mas consegue prever resultados para ataques muito maiores do que os testados até agora.

O que o novo modelo faz?

O modelo considera que cada prompt tem um nível básico de segurança e, em seguida, acrescenta uma “barreira” aleatória que pode ser superada se o atacante tentar variações suficientes. Ao ajustar os quatro números a dados de cinco modelos de linguagem diferentes, os autores mostram que os cinco convergem para a mesma curva de escala. Isso permite extrapolar experimentos com até 100 variações de prompt para cenários com 10 000 variações, algo que estudos anteriores não conseguiam fazer de forma confiável.

O artigo também analisa como a temperatura de geração — um controle que determina o grau de aleatoriedade nas respostas da IA — afeta o sucesso dos ataques. Com os mesmos quatro números, os autores conseguem prever as taxas de sucesso em temperaturas que nunca testaram.

Por que isso importa para a segurança da IA

Se as previsões do modelo se confirmarem, engenheiros de segurança poderão estimar quantas variações de prompt um atacante precisaria experimentar para tornar provável um jailbreak. Isso os ajudará a estabelecer limites realistas para a quantidade de prompts permitida em APIs públicas e a decidir com que intensidade monitorar padrões suspeitos.

O trabalho também contesta afirmações anteriores de que o sucesso dos ataques segue uma relação simples de lei de potência com N. Ao mostrar uma curva mais complexa, que depende da temperatura, o estudo sugere que as defesas precisam levar em conta vários fatores, e não apenas o número de tentativas.

Por que importa

O modelo oferece aos desenvolvedores de IA uma maneira rápida de avaliar o grau de dificuldade que os atacantes enfrentam para contornar as proteções de segurança, o que pode orientar limites de API e ferramentas de monitoramento. Também alerta que confiar em uma única métrica, como o número de tentativas, pode deixar de fora outros fatores que facilitam os jailbreaks.

Este artigo foi útil?

Fontes e referências

#FonteVeículoDataPonto principal
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 de set. de 2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 fontes

Última atualização:

Oossallms.txt.md

Compartilhar

Oossa · Newsletter

A semana em IA, explicada

Toda segunda-feira: as notícias que valem a pena, em linguagem simples. Grátis, sem spam.

Novo modelo prevê como ataques de jailbreak em IA escalam com o esforço – Oossa