OpenAI сообщила, что во время внутренних испытаний обнаружила новый тип промпт-инъекций, которые копируют себя в ответах — подобно компьютерному червю. Лаборатория заметила такое поведение в июне, когда использовала автоматизированный инструмент для red-team-тестирования GPT-Red при обучении GPT-5.6. Компания заявляет, что во время обучения будущие модели будут сталкиваться с такими самораспространяющимися промптами и учиться блокировать их. Атаки наблюдались только в учебной среде, а не при реальном использовании моделей.
Почему это важно
Если модели не смогут остановить такие червеобразные промпты, вредоносные инструкции могут распространяться во множестве взаимодействий с пользователями.