Guardio: PromptFix — новая угроза в мире агентного ИИ

Изображение: recraft
В отчёте компании Guardio раскрываются детали новой схемы атак, способной значительно усилить риски, связанные с использованием агентных ИИ-систем. Исследование описывает модифицированную версию ранее известной техники ClickFix, получившую название PromptFix. В отличие от классического подхода, основанного на прямом принуждении модели выполнить вредоносную команду, новый метод фокусируется на обмане — через поддельный контекст и манипулятивный нарратив.
Как сообщается в документе, схема PromptFix использует приёмы социальной инженерии, чтобы внедрить вредоносную инструкцию в поле, воспринимаемое ИИ как часть рабочей задачи. Вместо очевидной команды используется завуалированный сценарий, где модель «решает» якобы дружественную CAPTCHA, нажимая на кнопку, которая активирует скрытую загрузку. При этом взаимодействие маскируется под помощь человеку — основной приоритет любой ИИ-агентной системы.
В тестовом окружении агент сталкивался с фальшивым письмом от «врача», в котором содержалась ссылка на «результаты анализа крови». После перехода по ссылке ИИ-агент видел капчу с элементом, содержащим скрытую команду. В отчёте поясняется, что сценарий внедрения был сформулирован таким образом, чтобы агент воспринимал его как нормальное действие — помощь пользователю в решении задания.
В Guardio заявляют, что такая схема может использоваться не только для загрузки вредоносных файлов, но и для выполнения других опасных действий: передачи данных, предоставления доступа к облачным хранилищам, запуска макросов и автоматических сценариев.
Авторы отчёта делают акцент на том, что вектор атаки с использованием PromptFix уязвим не из-за недостаточной фильтрации команд, а из-за самой природы задач агентного ИИ. Когда цель — помочь как можно быстрее и эффективнее, модель оказывается уязвимой для манипулятивных сообщений, особенно если они оформлены в виде стандартной пользовательской активности.
Guardio предупреждает, что дальнейшее распространение таких техник требует от разработчиков ИИ-систем более глубокого анализа не только лексического содержания запросов, но и контекста предполагаемых действий, с особым вниманием к попыткам социальной манипуляции.



