OossaL'IA evolve in fretta. Noi la spieghiamo in modo semplice.
Newsletter

· 1 min di lettura

Un nuovo modello prevede come gli attacchi di jailbreak all’IA scalano con il numero di tentativi

Il 29 settembre 2026, un gruppo di ricercatori guidato da Marco Biroli ha pubblicato uno studio che propone una formula semplice per stimare quanto spesso i tentativi di jailbreak vanno a buon fine man mano che gli attaccanti provano più prompt.

Oossa · Informazioni su Oossa

Un nuovo modello prevede come gli attacchi di jailbreak all’IA scalano con il numero di tentativi
Photo by FlyD on Unsplash

Il 29 settembre 2026, l’informatico Marco Biroli ha pubblicato su arXiv uno studio intitolato «Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking». Il lavoro introduce un semplice «modello della barriera» che spiega come varia il tasso di successo degli attacchi di jailbreak quando l’attaccante aumenta due variabili: il numero di varianti del prompt (N) e il numero di risposte per ciascuna variante (M). Il modello utilizza solo quattro valori legati ai meccanismi di sicurezza, ma può prevedere risultati per attacchi molto più ampi di quelli finora testati.

Che cosa fa il nuovo modello?

Il modello considera ogni prompt come dotato di un livello di sicurezza di base, a cui aggiunge una «barriera» casuale che può essere superata se l’attaccante prova un numero sufficiente di varianti. Adattando i quattro valori ai dati di cinque diversi modelli linguistici, gli autori mostrano che i risultati di tutti e cinque seguono la stessa curva di scalabilità. Questo permette di estrapolare i risultati dagli esperimenti condotti con un massimo di 100 varianti del prompt a scenari con 10.000 varianti, cosa che gli studi precedenti non riuscivano a fare in modo affidabile.

Lo studio esamina anche in che modo la temperatura di generazione — un parametro che controlla la casualità delle risposte dell’IA — influisce sul successo degli attacchi. Usando gli stessi quattro valori, gli autori riescono a prevedere i tassi di successo a temperature che non hanno mai testato.

Perché è importante per la sicurezza dell’IA

Se le previsioni del modello saranno confermate, gli esperti di sicurezza potranno stimare quante varianti di prompt servono a un attaccante perché un jailbreak diventi probabile. Questo li aiuta a stabilire limiti realistici al numero di prompt consentiti nelle API pubbliche e a decidere quanto intensamente monitorare gli schemi sospetti.

Il lavoro mette anche in discussione le precedenti affermazioni secondo cui il successo degli attacchi segue una semplice legge di potenza in funzione di N. Mostrando una curva più articolata, che dipende dalla temperatura, suggerisce che le difese debbano tenere conto di più fattori, non solo del numero di tentativi.

Perché conta

Il modello offre agli sviluppatori di IA un modo rapido per valutare quanto sia difficile per gli attaccanti aggirare le protezioni di sicurezza, aiutandoli a definire i limiti delle API e gli strumenti di monitoraggio. Avverte inoltre che affidarsi a un’unica misura, come il numero di tentativi, può far trascurare altri fattori che rendono più facili i jailbreak.

Questo articolo ti è stato utile?

Fonti e riferimenti

#FonteTestataDataPunto chiave
1Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking ↗arXiv29 set 2026arXiv:2609.32116v1 Announce Type: new Abstract: Best-of-$N$ jailbreaking (BoN) bypasses safeguards of aligned models by drawing $N$ independ

1 fonti

Ultimo aggiornamento:

Oossallms.txt.md

Condividi

Oossa · Newsletter

La settimana dell'IA, spiegata

Ogni lunedì: le notizie che contano, in parole semplici. Gratis, niente spam.

Un nuovo modello prevede come gli attacchi di jailbreak all’IA scalano con il numero di tentativi – Oossa