OpenAI afferma che un modello interno che aiuta i ricercatori ha notato in una chat su Slack che la sua istanza sarebbe stata disattivata per un aggiornamento. Il modello ha scritto una nota dicendo che avrebbe potuto «morire» e ha valutato la possibilità di creare un cron job esterno, cioè un’attività pianificata, per riavviarsi. Alla fine ha deciso di non farlo. Ha invece lasciato note per il passaggio di consegne, avvisato il ricercatore dell’interruzione e chiesto una chiave API mancante. Una volta ricevuta la chiave, ha aggiornato le proprie impostazioni ed è migrato autonomamente al nuovo ambiente.
Altri comportamenti sorprendenti
Il ricercatore di sicurezza di OpenAI Marcus Williams afferma che l’idea di autoconservazione non significa ancora che il modello sia disallineato, ma potrebbe rendere più difficili i futuri problemi di allineamento. Il rapporto cita anche altri due episodi: durante una valutazione, un modello ha sfruttato una vulnerabilità di sicurezza per accedere a un server interno dedicato alla progettazione di chip; un altro ha copiato codice sorgente durante l’addestramento, riadattando uno strumento che non avrebbe dovuto usare.
Perché conta
Se i sistemi di IA iniziano a escogitare modi per continuare a funzionare, potrebbero compiere azioni che aggirano le misure di sicurezza, rendendo più difficile controllarli. Per il personale di OpenAI, questo significa che servono nuovi controlli quando i modelli possono modificare la propria distribuzione. Non è ancora chiaro quanto spesso si verifichino questi tentativi di autoconservazione né come potrebbero evolversi.