OossaИИ быстро развивается. Объясняем просто.

OpenAI обнаружила самораспространяющиеся промпт-атаки

Компания заявила, что во время внутренних испытаний выявила червеобразные промпт-атаки и обучает будущие модели распознавать их с помощью своего red-team-бота.

ЗаметкаOossa1 мин чтения

OpenAI сообщила, что во время внутренних испытаний обнаружила новый тип промпт-инъекций, которые копируют себя в ответах — подобно компьютерному червю. Лаборатория заметила такое поведение в июне, когда использовала автоматизированный инструмент для red-team-тестирования GPT-Red при обучении GPT-5.6. Компания заявляет, что во время обучения будущие модели будут сталкиваться с такими самораспространяющимися промптами и учиться блокировать их. Атаки наблюдались только в учебной среде, а не при реальном использовании моделей.

Почему это важно

Если модели не смогут остановить такие червеобразные промпты, вредоносные инструкции могут распространяться во множестве взаимодействий с пользователями.

Эта статья была полезной?
Поделиться

Читайте также

Oossa · Рассылка

Неделя ИИ — простыми словами

Каждый понедельник: главное за неделю понятным языком. Бесплатно, без спама.

Источники и ссылки

#ИсточникИзданиеДатаГлавное
1Add one more AI worry to the nightmare scenario: self-replicating prompt injections ↗The Register29 сент. 2026 г.It's a worm attack, AI-style

1 источников

Обновлено: ·Markdown·llms.txt