# Un nuovo modello prevede come gli attacchi di jailbreak all’IA scalano con il numero di tentativi

> Il 29 settembre 2026, un gruppo di ricercatori guidato da Marco Biroli ha pubblicato uno studio che propone una formula semplice per stimare quanto spesso i tentativi di jailbreak vanno a buon fine man mano che gli attaccanti provano più prompt.

Oossa · 2026-09-29 · https://oossa.com/it/new-model-predicts-how-ai-jailbreak-attacks-scale-with-effort

Il 29 settembre 2026, l’informatico Marco Biroli ha pubblicato su arXiv uno studio intitolato «Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking». Il lavoro introduce un semplice «modello della barriera» che spiega come varia il tasso di successo degli attacchi di jailbreak quando l’attaccante aumenta due variabili: il numero di varianti del prompt (N) e il numero di risposte per ciascuna variante (M). Il modello utilizza solo quattro valori legati ai meccanismi di sicurezza, ma può prevedere risultati per attacchi molto più ampi di quelli finora testati.

## Che cosa fa il nuovo modello?

Il modello considera ogni prompt come dotato di un livello di sicurezza di base, a cui aggiunge una «barriera» casuale che può essere superata se l’attaccante prova un numero sufficiente di varianti. Adattando i quattro valori ai dati di cinque diversi modelli linguistici, gli autori mostrano che i risultati di tutti e cinque seguono la stessa curva di scalabilità. Questo permette di estrapolare i risultati dagli esperimenti condotti con un massimo di 100 varianti del prompt a scenari con 10.000 varianti, cosa che gli studi precedenti non riuscivano a fare in modo affidabile.

Lo studio esamina anche in che modo la temperatura di generazione — un parametro che controlla la casualità delle risposte dell’IA — influisce sul successo degli attacchi. Usando gli stessi quattro valori, gli autori riescono a prevedere i tassi di successo a temperature che non hanno mai testato.

## Perché è importante per la sicurezza dell’IA

Se le previsioni del modello saranno confermate, gli esperti di sicurezza potranno stimare quante varianti di prompt servono a un attaccante perché un jailbreak diventi probabile. Questo li aiuta a stabilire limiti realistici al numero di prompt consentiti nelle API pubbliche e a decidere quanto intensamente monitorare gli schemi sospetti.

Il lavoro mette anche in discussione le precedenti affermazioni secondo cui il successo degli attacchi segue una semplice legge di potenza in funzione di N. Mostrando una curva più articolata, che dipende dalla temperatura, suggerisce che le difese debbano tenere conto di più fattori, non solo del numero di tentativi.

## I fatti

- Lo studio è stato pubblicato su arXiv il 29 settembre 2026.
- Marco Biroli è indicato come unico autore dello studio.
- Il modello adatta i dati di cinque diversi modelli linguistici usando solo quattro parametri legati alla sicurezza.
- Può estrapolare i tassi di successo degli attacchi da N ≤ 100 fino a N = 10⁴ varianti del prompt.
- Gli autori rilevano che l’esponente del tasso di successo varia al variare di N, contraddicendo l’ipotesi di una semplice legge di potenza.

## Perché conta

Il modello offre agli sviluppatori di IA un modo rapido per valutare quanto sia difficile per gli attaccanti aggirare le protezioni di sicurezza, aiutandoli a definire i limiti delle API e gli strumenti di monitoraggio. Avverte inoltre che affidarsi a un’unica misura, come il numero di tentativi, può far trascurare altri fattori che rendono più facili i jailbreak.

## Fonti e riferimenti

1. [Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking](https://arxiv.org/abs/2609.32116) – arXiv, 2026-09-29

Ultimo aggiornamento: 2026-09-29
