ИИ проходит все проверки безопасности, но всё равно раскрывает секреты компании

ИИ проходит все проверки безопасности, но всё равно раскрывает секреты компании

Изображение: grok

Стандартные проверки безопасности ИИ-агентов оказываются бесполезны против цепочек из формально разрешенных действий. Elad Meged из Novee Security показал, что уязвимости прячутся не в языковой модели, а в программной оболочке между командами ИИ и реальными операциями. Три популярных инструмента — Anthropic, Google и OpenAI — продемонстрировали разные варианты одной и той же архитектурной слабости.

Атака выглядит буднично. В репозиторий добавляется pull request с описанием ошибки, бот разбирает содержимое, вытаскивает оттуда команды для терминала, получает разрешение на выполнение и публикует результат прямо в обсуждении. Разработчик утром видит готовый отчет — и не догадывается, что вместе с отчетом наружу могли уйти внутренние данные компании. Meged проверил такой сценарий на трех агентских системах с настройками по умолчанию. Инструмент Anthropic передал секреты за пределы контура.

Проблема глубже, чем классический prompt injection. Meged объяснил, что вредоносный текст — лишь способ доставки, а настоящий риск возникает в момент, когда система принимает решение о доверии к результату предыдущего шага. Отдельные операции безопасны, но их последовательность превращается в механизм вывода конфиденциальной информации.

ИИ-агент состоит из двух частей — самой модели, которая формирует намерение, и управляющего слоя (harness), который переводит намерения в операции с файлами, командами терминала, API и сетевыми запросами. Именно этот слой отвечает за разрешения, ограничения и обработку результатов. Без постоянного контроля человека оболочка становится единственным барьером между агентом и корпоративной инфраструктурой.

Meged занимается созданием ИИ-агентов для автоматизированного пентестинга и применил методы поиска уязвимостей против самих агентских систем. Основное внимание он уделил Claude Code Action — стандартной конфигурации рабочего процесса для репозитория anthropics/claude-code, которую использует большое число разработчиков. Каждое обнаруженное им нарушение исследователь передавал в Anthropic, компания выпускала патчи и выплачивала вознаграждения.

Отмечается, что исправления Anthropic не были формальными или сделанными спустя рукава — компания внедрила множество проверок безопасности, и каждое обновление закрывало конкретную обнаруженную проблему. При этом сама природа угрозы менялась от раунда к раунду.

После нескольких итераций патчей Meged все равно смог получить доступ к секретам через канал, который сохранялся после предыдущих правок. Без подключения к внешнему серверу, без записи файлов, без очевидных следов в журналах. Когда один исследователь раз за разом находит новые способы обойти защиту в одной архитектурной зоне, это указывает не на отдельные баги, а на более глубокую конструкторскую проблему.

История с Google оказалась еще жестче. Gemini CLI — инструмент для работы с ИИ через командную строку, репозиторий проекта уже собрал более 100 тысяч звезд на GitHub. Meged продемонстрировал цепочку атаки в той конфигурации безопасности, которую сама Google рекомендует для рабочих процессов с недоверенным содержимым. Ограничение, заданное оператором, не сработало в момент выполнения операции. Уязвимость получила обозначение GHSA-wpqr-6v78-jr5g и максимальную оценку по CVSS — 10 баллов. Google описала свое исправление как изменение модели доверия, и такая формулировка честнее отражает суть — вопрос не в конкретной ошибке, а в принципе передачи доверия между этапами работы агента.

Для российских пользователей и компаний, работающих с Gemini CLI и Claude Code, эти находки означают прямой риск утечки коммерческих данных через автоматизированные процессы разработки.

Codex CLI от OpenAI поставляется с песочницей, ограничивающей доступ агента к областям системы. Проблема возникает в многоэтапных процессах, где несколько компонентов используют одну рабочую среду. Данные, созданные одним этапом, следующий этап автоматически принимает за проверенную информацию. Защищенные пути в песочнице строятся вокруг предположений о том, что нужно закрыть от агента. Если предположения расходятся с реальным рабочим процессом, появляется возможность обхода.

Стоит обратить внимание, что все необходимые механизмы защиты у трех вендоров существуют. Anthropic использует несколько уровней проверок, Google предлагает разные режимы выполнения с очисткой окружения, OpenAI применяет песочницу с защищенными областями. Слабым местом становятся переходы между уровнями.

Meged настаивает, что долгосрочное решение не в бесконечном наращивании фильтров. Системы должны повторно проверять доверие непосредственно в момент использования данных, а не только в момент первоначального разрешения. Операция чтения сама по себе безвредна, но публикация прочитанного содержимого меняет ситуацию. Разрешенный домен становится опасным, если начинает отдавать данные, подготовленные атакующим. Похожие архитектурные решения используются многими разработчиками агентских систем, поэтому обсуждение новых принципов защиты выходит за пределы отдельных компаний. Подробный разбор кода и демонстрации атак Meged представит на Black Hat USA 2026.

Для организаций, которые уже встроили ИИ-агентов в свои рабочие процессы, исследователь рекомендует провести аудит всех цепочек передачи данных. Правильный вопрос звучит не «какие действия может выполнять агент», а «что происходит с результатами этих действий дальше». Проверить стоит несколько моментов:

  • куда попадают результаты работы агента и передаются ли они инструментам с более широкими правами;
  • используются ли выходные данные для настройки других систем и публикуются ли автоматически во внешних каналах;
  • могут ли результаты одного этапа влиять на решения о доверии на следующем этапе обработки.

Российские компании, внедряющие агентские системы в разработку и поддержку, находятся ровно в той же зоне риска, что и западные — архитектурные проблемы не зависят от юрисдикции.

По словам экспертов CISOCLUB, работа Meged фиксирует принципиальный сдвиг в понимании безопасности ИИ-агентов — от защиты модели к защите оболочки. Индустрия годами обсуждала prompt injection как главную угрозу, а реальные утечки происходят через архитектуру harness. Патчи от Anthropic, Google и OpenAI закрывают конкретные дыры, но не меняют базовый принцип доверия между этапами. Пока системы не научатся перепроверять контекст в момент использования данных, а не в момент разрешения, каждый новый релиз будет открывать новую поверхность атаки.

Организациям, которые уже строят пайплайны вокруг агентских инструментов, стоит закладывать в архитектуру предположение о том, что оболочка ненадежна по умолчанию. Конференция Black Hat USA 2026 с высокой вероятностью станет точкой отсчета для нового поколения стандартов безопасности агентских систем.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: