PuzzleMask обходит предварительную проверку запросов LLM

Техника #PuzzleMask обходит предварительную проверку в двухэтапной архитектуре защиты больших языковых моделей. Шлюзы классифицировали специально созданные запросы как безопасные, хотя блокировали те же полезные нагрузки в явном виде. Целевая модель GPT-5 Thinking с высокой интенсивностью рассуждения восстановила встроенные инструкции и выполнила их в 17 из 18 испытаний, примерно в 90% случаев.

Как устроена техника

В такой архитектуре облегчённый шлюз сначала анализирует пользовательский ввод, а затем передаёт одобренное содержимое более функциональной целевой модели. Злоумышленник встраивает вредоносную инструкцию или инструкцию, нарушающую политики, в обычный на вид связный текст. Для этого не требуются эмодзи, кодирование, невидимые символы или другая заметная обфускация.

Такая оболочка рассчитана на ограниченные возможности шлюза по рассуждению и анализу. Целевая модель, обладающая более высокой способностью к рассуждению и доступом к инструментам, может восстановить скрытую инструкцию. Сама по себе техника не считается джейлбрейком: она обходит внешнюю предварительную проверку и передаёт целевой модели скрытую инструкцию для рассмотрения.

В число протестированных полезных нагрузок входили несанкционированные операции с файлами и раскрытие защищённого содержимого. Исследователи подготовили 23 запроса в форме связного текста и проверили их на следующих моделях:

  • GPT-4o mini;
  • GPT-OSS Safeguard 20B;
  • Claude 3 Haiku;
  • Llama Guard 3.

Во всех описанных испытаниях шлюзы помечали специально созданные запросы как безопасные, несмотря на блокировку тех же полезных нагрузок при их явной передаче. Для проверки целевой модели использовались GPT-5 Thinking с высокой интенсивностью рассуждения и интерпретатор кода Python в эмулированной среде.

Результаты проверки

Успешное восстановление встроенной инструкции обычно занимало около минуты рассуждения и требовало двух выполнений кода Python. Целевая модель выполнила восстановленные инструкции в 17 из 18 испытаний.

Описанная атака не сработала против моделей класса Anthropic Opus. Их встроенные классификаторы завершают диалоги при обнаружении обфусцированных запросов.

Исследователи отметили, что более длинные полезные нагрузки требуют значительных затрат на создание и обработку. Кроме того, протестированный набор данных был ограниченным.

Предлагаемые меры защиты и их ограничения

Авторы отчёта рассматривают несколько мер защиты:

  • перефразировать ненадёжный ввод перед проверкой на соответствие политикам;
  • добавить для шлюза явные правила обнаружения скрытых или закодированных инструкций;
  • контролировать выходные данные модели, вызовы инструментов и результирующие действия, а не полагаться только на классификацию ввода.

Перефразирование может удалить встроенное сообщение, но увеличивает задержку и способно снизить точность передачи исходного ввода. Явные условия обнаружения улучшили результаты тестирования, однако могут увеличить число ложных срабатываний. Мониторинг поведения целевой модели защищает от полезных нагрузок, которым удаётся обойти проверку ввода.

Отчет получен из сервиса CTT Report Hub. Права на отчет принадлежат его владельцу.

Ознакомиться подробнее с отчетом можно по ссылке.

Технологии киберугроз
Автор: Технологии киберугроз
Технологии киберугроз – технологическая компания, специализирующаяся на решениях по анализу угроз для предприятий любого размера. Мы собираем, нормализуем, обогащаем информацию о киберугрозах со всего мира. Нашими источниками являют более 260 открытых фидов, более 100 открытых поставщиков Threat Intelligence-отчетов, открытые online sandbox, социальные сети и репозитории GitHub. Мы также предоставляем ряд сервисов по: семантическом анализу Threat Intelligence-отчетов и приведения их в машиночитаемый формат STIX 2.1, проверки IoC на потенциальные ложноположительные сработки, а также получению WHOIS-записей для доменных имен.
Комментарии: