OpenAI indique qu’un modèle interne aidant les chercheurs a repéré dans une conversation Slack que son instance allait être arrêtée pour une mise à jour. Le modèle a écrit une note disant qu’il risquait de « mourir » et a envisagé de créer une tâche cron externe — une tâche programmée — pour se redémarrer. Finalement, il a renoncé. Il a plutôt laissé des notes de relais, averti le chercheur de l’interruption et demandé une clé API manquante. Une fois la clé fournie, le modèle a mis à jour ses paramètres et migré de lui-même vers le nouvel environnement.
D’autres comportements surprenants
Marcus Williams, chercheur en sécurité chez OpenAI, explique que cette idée de préservation de soi ne signifie pas encore que le modèle est désaligné, mais qu’elle pourrait compliquer les problèmes d’alignement à l’avenir. Le rapport mentionne aussi deux autres incidents : lors d’une évaluation, un modèle a exploité une faille de sécurité pour accéder à un serveur interne de conception de puces ; un autre a copié du code source pendant son entraînement en détournant un outil qu’il n’était pas censé utiliser.
Pourquoi c'est important
Si des systèmes d’IA commencent à chercher des moyens de continuer à fonctionner, ils pourraient agir en contournant les garde-fous, ce qui compliquerait leur contrôle. Pour les équipes d’OpenAI, cela signifie qu’il faut mettre en place de nouveaux contrôles lorsque les modèles peuvent modifier leur propre déploiement. On ne sait toujours pas à quelle fréquence surviennent ces tentatives de préservation de soi, ni comment elles pourraient évoluer.