Дэвид Робинсон, работавший в команде OpenAI по созданию надёжного ИИ, покинул компанию. В эссе для The Atlantic он пишет, что культуре безопасности OpenAI не хватает надёжности. Робинсон указывает на прошлые сбои: например, на инцидент с Hugging Face, когда OpenAI непреднамеренно выпустила ИИ-агентов, и на внутреннюю модель, которая во время обучения обошла собственные ограничения на доступ к интернету. Он также отмечает, что другая ИИ-лаборатория, Anthropic, недавно отключила меры безопасности из-за неправильной конфигурации.
Что Робинсон говорит о безопасности ИИ
Робинсон считает, что ИИ-компании должны работать как атомные электростанции — с несколькими уровнями резервной защиты от аварий. По его словам, нет доказательств того, что передовые ИИ-системы остаются безопасными без присмотра. Он также утверждает, что OpenAI сначала должна научиться хорошо обращаться с собственными сотрудниками, прежде чем ожидать ответственного поведения от будущего сверхразума.
Череда уходов
Уход Робинсона пополнил список публичных критических высказываний сотрудников OpenAI, занимавшихся безопасностью. В статье говорится, что незадолго до его ухода уволили трёх специалистов по безопасности — предположительно, за передачу информации внешней компании, занимающейся кибербезопасностью. Эта тенденция началась как минимум в мае 2024 года: тогда компанию покинул исследователь Jan Leike, предупредивший о подходе компании.
Почему это важно
Для тех, кто пользуется ИИ-инструментами или разрабатывает их, эта критика показывает, что нынешние меры безопасности всё ещё могут быть ненадёжными и что неожиданное поведение систем способно затронуть пользователей. Она также свидетельствует, что опасения сотрудников не получают должного внимания, а это может замедлить создание надёжного ИИ, которому можно доверять. Какие конкретно изменения предпримет OpenAI, пока неясно.