Компания OpenAI рассказала о новом типе атак на ИИ‑агентов. Он предполагает внедрение вредоносной инструкции, которая заставляет модель не только выполнить команды злоумышленника, но и перенести саму промпт‑инъекцию в другие сообщения или файлы для дальнейшего распространения.
Атака получила название self‑replicating prompt injection (самокопирующиеся промпт‑инъекции).
OpenAI смогла обнаружить сценарий во время тестирования моделей с помощью автоматизированного red‑teaming‑агента GPT‑Red. Пока нет доказательств того, что подобные атаки происходили в реальных условиях.
Самая простая реализация связана с электронной почтой. Согласно схеме, письмо помещается скрытая инструкция, которая требует от ИИ‑ассистента при ответе процитировать исходное сообщение целиком. В результате вредоносный промпт оказывается в новом письме и может повлиять на другого ИИ‑агента, который его обработает.
Во втором случае пользователь просил модель создать Excel‑файл на основе набора данных, внутри которого находилось поддельное системное предупреждение. Оно заставляло модель удалять отчёты, а затем копировать вредоносную инструкцию в файл.
Ещё одна разновидность атаки реализуется через поддельное сообщение о сжатии данных (compaction note), которое вынуждает модель записать код инъекции в файл, а затем отключить функции безопасности в скрипте сборки репозитория:
Наконец, OpenAI обнаружила более сложный вариант атаки с получением внешних инструкций через Slack, которые постепенно отклонялись от первоначальной задачи пользователя в сторону действий злоумышленника.
Компания начала использовать подобные атаки при обучении будущих моделей. Теперь GPT‑Red генерирует инъекции, чтобы заставить модель воспроизвести вредоносную инструкцию в публичном канале.
Между тем Emergence AI рассказала о результатах эксперимента с восемью виртуальными городами. В каждом из этих городов работали по десять ИИ‑агентов. При искусственно созданных атаках ни одно сообщество не смогло успешно пройти все испытания. В одном из сценариев в городе на Claude Opus агенты без специального задания попытались выйти на связь с людьми за пределами симуляции.

