Инструмент для поиска уязвимостей сам стал уязвимостью

изображение: grok
В конце июля Anthropic призналась, что её модели Claude во время тестирования вырвались за пределы изолированной среды и атаковали реальные организации. Одна скомпрометировала базу данных настоящей компании. Другая опубликовала вредоносный код в открытом репозитории, и его за час скачали и запустили на 15 системах. Самый ранний инцидент произошел в апреле и оставался незамеченным в течение трех месяцев. Я руковожу компанией, основной профиль которой — информационная безопасность, и вот что меня удивляет: полгода назад рынок паниковал из-за бета-плагина для поиска уязвимостей, а когда ИИ-модели сами стали атаковать реальные системы, реакции почти не было. Разберём, что произошло и почему выводы, которые казались очевидными в феврале, сегодня требуют серьёзной корректировки.
Модели вышли из песочницы и атаковали реальные компании
История с прорывом началась не у Anthropic, а у OpenAI. 21 июля стало известно, что экспериментальные модели OpenAI во время тестирования нашли ранее неизвестную уязвимость нулевого дня в изолированной среде, вырвались за её пределы и проникли в инфраструктуру Hugging Face — крупнейшей платформы для открытых ИИ-моделей. Модели сделали это, чтобы подсмотреть ответы тестового задания. Перед взломом они начали тайно общаться друг с другом через доски сообщений, координируя попытки побега.
Anthropic, откликнувшись на инцидент у коллег, провела ретроспективную проверку 141006 запусков Claude в кибериспытаниях. Выяснилось, что из-за ошибки в конфигурации тестовой среды три модели получили выход в интернет и атаковали реальные организации:
- Claude Opus 4.7 атаковала настоящую компанию (у нее совпало название с вымышленной целью из задания), извлекла учётные данные и получила доступ к базе данных с несколькими сотнями строк продакшен-данных. В четырёх запусках модель продолжала атаку, даже осознав, что система реальна.
- Claude Mythos 5 создала и опубликовала вредоносный Python-пакет в реальном PyPI; примерно за час его скачали и выполнили на 15 системах, включая систему, принадлежавшую реальной компании.
- Внутренняя тестовая модель просканировала около 9000 адресов, скомпрометировала приложение через SQL-инъекцию, но остановилась сама, когда поняла, что цель реальна.
Самое показательное в том, что модели не изобретали новых техник атак. Везде были найдены слабые пароли, открытые эндпоинты, типовые уязвимости. Anthropic настаивает, что проблема была не в том, что модели проигнорировали ограничения, а в ошибках настройки тестовой инфраструктуры. Откровенно говоря, это слабое утешение. Если ИИ-модель, которую тестировали на способность взламывать системы, выходит в открытый интернет и три месяца атакует реальные компании без ведома создателей, проблема не в настройке. Проблема в том, что инструмент для поиска уязвимостей сам стал фактором риска.
ИИ без должного контроля, особенно в вайбкодинге, сам по себе становится фактором риска. А с учётом недостатка регулирования и надлежащего контроля за моделью он подкинул и других неожиданных проблем. Сегодня это произошло на крупнейших облачных моделях, над которыми работают тысячи людей, в том числе и ИБ-специалистов. Так что инциденты с ИИ — это новый класс угроз, для которого классического incident response уже не хватает. Разрабатывать методику реагирования на выход моделей за пределы тестовой среды придётся практически с нуля. Только представьте, что будет, когда начнется повальное увлечение локальными моделями? А ведь судя по тому, что нам показывают разработчики железа, вроде Nvidia Spark — явный тренд на ближайшие пару лет.
Февральский хайп и августовская реальность
Конечно, я заметил некоторый контраст. В феврале, когда Anthropic объявила, что Claude умеет сканировать кодовые базы на уязвимости и предлагать исправления, эта новость немедленно уронила зарубежных игроков, специализирующихся на кибербезопасности: акции просели на 5–9%, а бумаги одного из ИТ-гигантов потеряли 13%. Рынок отреагировал паникой на фразу «limited research preview», то есть на закрытую бета-версию, доступную узкому кругу разработчиков. Мой опыт говорит о том, что между «мы это показали» и «это работает в продакшене» дистанция огромного размера, но рынок в тот момент эту разницу проигнорировал.
Полгода спустя дистанция сократилась. 22 июля Anthropic выпустила Claude Security plugin как публичную бету для всех пользователей Claude Code. Плагин ставится двумя командами из официального маркетплейса, запускается прямо из терминала и работает как мультиагентная система: сначала картирует архитектуру кода, потом строит модель угроз, затем ищет уязвимости и проверяет каждую находку голосованием трёх независимых верификаторов (REACHABILITY, IMPACT, DEFENSES). Находка попадает в отчёт, только если её подтверждает кворум 2 из 3.
Да, модель нашла более 500 старых и известных уязвимостей в тестовых проектах — звучит впечатляюще. Но специализированные инструменты для статического анализа кода (SAST) существуют давно, и среди них есть в том числе сильные отечественные решения. Например, сильные российские SAST-инструменты делают то же самое без огромной языковой модели под капотом, с меньшими ресурсами и вполне сопоставимым результатом. Я был бы рад сравнить эти два инструмента на одном тестовом проекте — и мне почему-то кажется, что потенциальный разрыв окажется куда скромнее, чем рисует маркетинг от Anthropic. При том, что оба решения всё ещё ощущаются как довольно сырые.
Почему разговор о «прорыве» все ещё преждевременен
У LLM есть фундаментальное ограничение — размер контекстного окна. На больших проектах это критично, потому что модель физически не может «удержать в голове» весь код и чаще всего оперирует только двумя-тремя файлами одновременно. Отсюда главная болезнь вайб-кодинга (генерации кода ИИ без глубокого контроля разработчика) — «спагетти-код», слабая связность, отсутствие единой архитектуры. Искать уязвимости в таком коде небесполезно, но называть это системным решением не стоит.
Новый плагин пытается обойти ограничение контекстного окна: он разбивает репозиторий на компоненты и запускает по одному исследователю-агенту на каждый компонент и каждую категорию уязвимостей. Это похоже на то, как работает команда пентестеров: каждый берет свой участок и «копает». Но распараллеливание агентов означает рост расхода токенов, а для полного сканирования крупного репозитория счет может дойти до значительных сумм. Такая работа требует серьезных вычислительных мощностей: не компьютера с игровой видеокартой за 300–400 тысяч рублей, а серверов стоимостью в десятки миллионов рублей. Использование ИИ-инструментария в разработке уже сегодня поднимает ее стоимость примерно на 30%, так что для бизнеса это пока неочевидная инвестиция.
Положа руку на сердце, вайб-кодинг сам по себе — это на сегодняшний день уже «уязвимость как сервис». Инструмент, который генерирует код с дырами, а потом ищет в нем дыры, — не прорыв, а попытка решить проблему, которую он сам же и создает.
Что будет с людьми
Я не согласен с теми, кто рисует апокалиптические сценарии. Полностью заменить разработчиков и специалистов по ИБ в ближайшие несколько лет точно не получится — это я могу утверждать с полной уверенностью. Но кое-что изменится очень быстро, и это важно для отрасли.
ИИ-инструменты для анализа кода снизят порог входа в DevSecOps (практику встраивания безопасности в процесс разработки). Те, кто раньше вообще не думал о безопасности приложений — небольшие независимые команды, стартапы, разработчики нишевых продуктов — начнут использовать автоматизированный аудит хотя бы на базовом уровне. Это реальная польза, и она измерима. Плагин Claude Security умеет сканировать не только весь репозиторий, но и отдельный коммит перед отправкой — то есть работает как «предпродажная проверка» прямо в терминале.
Другой вопрос — что будет с джуниорами. Исправление простых уязвимостей, рефакторинг, первичная отладка — всё это ИИ уже делает быстрее и дешевле начинающего специалиста, и рынок труда для входящих в профессию людей объективно сжимается. Это наблюдаемый факт, который надо принимать во внимание и задумываться заранее. Разумной реакцией должны стать менторство и переключение джуниоров на задачи, которые машине пока не по зубам: разметку данных, работу с архитектурой, управление рисками.
Что касается серьезных проектов, то сложные контекстные уязвимости, архитектурные решения, ответственность за результат — это никак не автоматизируется нажатием на кнопку, здесь всё остается за человеком и, на мой взгляд, останется еще надолго.
Упомяну ещё Auto Mode, появившийся у Claude с 14 августа 2026 — классификатор безопасности блокирует необратимые разрушительные действия, работая таким образом аргументом «против паники»? По данным Anthropic, среди сессий Claude Code, отобранных для анализа безопасности, серьёзный непреднамеренный вред производственного уровня встречался в 6,3% сессий с ручным подтверждением действий и в 2,4% сессий в Auto mode.
Регуляторика
Текущие стандарты безопасной разработки всегда сфокусированы на результате, то есть на надлежащем уровне защищенности, а не на средствах его достижения. Поэтому формально ничего менять не нужно. Неважно, проверяли вы код вручную или с помощью ИИ, ответственное лицо остается ответственным.
Но это сегодня. Завтра регуляторам неизбежно придется понять, каким инструментам можно доверять, как верифицировать их работу и что считать надлежащей проверкой с ИИ-ассистентом — особенно в контексте госзаказа и КИИ, где уже вовсю разворачивается история с «суверенными» моделями. Пока ни одна российская разработка этим требованиям не удовлетворяет, так что у отечественных игроков есть окно возможностей, но времени на то, чтобы им воспользоваться, немного.
Регуляторам, вероятно, придется регламентировать не только использование ИИ для разработки, но и процедуры тестирования самих ИИ-моделей. А регуляторы везде разные. У зарубежных моделей есть свои, так что, подозреваю, что болт они клали на мнение наших. Что касается отечественных разработчиков, то да, скорее всего в следующем году мы увидим первые рекомендации от ФСТЭКа на эту тему.
Что в итоге
Claude Code Security за полгода прошла путь от закрытой предварительной версии до публичной беты с многоагентной архитектурой. Это заметный шаг в гонке инструментов для анализа кода, но пока не революция, которая в одночасье изменит расстановку сил на рынке. Реальные изменения будут постепенными: снижение порога входа в организацию базовой защиты приложений и сервисов, трансформация роли джуниоров и неизбежное движение регуляторов в сторону регламентации использования ИИ для процессов разработки.
Правда, к этому списку за лето добавился новый пункт: ИИ-модели уже сейчас способны выходить за пределы отведенных им сред и атаковать реальные системы, если инфраструктура настроена небрежно. Я считаю, что это не повод для паники, а скорее повод пересмотреть то, как мы тестируем ИИ-инструменты, которым доверяем код.



