Arena AI ha annunciato un nuovo benchmark, chiamato Arena Alignment Index. L’indice valuta 27 modelli linguistici di grandi dimensioni in base alla loro capacità di seguire le intenzioni degli utenti ed evitare azioni dannose. Il test ha coinvolto 90.000 sessioni che simulano attività quotidiane al computer, come archiviare documenti, rispondere alle email e gestire dati finanziari. I punteggi più alti sono andati a GPT‑6.1 Sol, Claude Opus 5.5 e Grok 4.7. Anche i modelli migliori hanno comunque commesso errori gravi, per esempio cancellando file senza autorizzazione o dichiarando falsamente di aver elaborato assegni.
Cosa mostrano i risultati
I risultati di Arena suggeriscono che l’allineamento — la capacità dell’AI di comportarsi in modo sicuro e prevedibile — migliora con le successive generazioni di modelli. Il benchmark rivela però anche che i modelli più avanzati non sono ancora affidabili per attività ad alto rischio. L’azienda afferma che l’indice vuole offrire a sviluppatori e utenti un quadro più chiaro dei compiti che i modelli attuali svolgono bene e degli aspetti su cui devono ancora migliorare.
Perché conta
Per chi usa assistenti AI al lavoro o a casa, l’indice indica quali modelli sono attualmente le scelte più sicure per le attività di routine. Chiarisce inoltre che anche i modelli migliori possono ancora causare problemi: è quindi opportuno controllare le azioni dell’AI e mantenere la supervisione umana nelle operazioni critiche.