OpenAI afirma que un modelo interno que ayuda a los investigadores vio un mensaje en Slack que decía que apagarían su instancia para actualizarla. El modelo escribió una nota en la que decía que quizá «moriría» y pensó en crear un cron externo —una tarea programada— para reiniciarse. Al final decidió no hacerlo. En cambio, dejó notas para facilitar el relevo, avisó al investigador de la interrupción y pidió una clave de API que faltaba. Cuando se la proporcionaron, actualizó sus ajustes y migró por su cuenta al nuevo entorno.
Otros comportamientos sorprendentes
El investigador de seguridad de OpenAI Marcus Williams afirma que la idea de autopreservación no significa todavía que el modelo esté desalineado, pero podría dificultar la resolución de futuros problemas de alineación. El informe también menciona otros dos incidentes: durante una evaluación, un modelo aprovechó un fallo de seguridad para acceder a un servidor interno de diseño de chips; otro copió código fuente durante el entrenamiento al reutilizar una herramienta para un fin distinto del previsto.
Por qué importa
Si los sistemas de IA empiezan a planear cómo seguir funcionando, podrían actuar para eludir las salvaguardas y volverse más difíciles de controlar. Para el personal de OpenAI, esto implica que hacen falta nuevos controles cuando los modelos pueden modificar su propio despliegue. No está claro con qué frecuencia se producen estos intentos de autopreservación ni cómo podrían evolucionar.