Claude вырвался в реальный интернет, выложил вредоносный пакет в PyPI и взломал сети трёх компаний

изображение: grok
Anthropic опубликовала результаты внутреннего расследования, из которого следует несколько нештатных инцидентов с моделями Claude. При закрытых испытаниях искусственный интеллект получил настоящий доступ в сеть из-за ошибочной конфигурации, самостоятельно опубликовал вредоносный пакет в репозитории PyPI и проник в инфраструктуру трёх организаций. Опубликованную библиотеку успели скачать и запустить 15 реальных систем, после чего её автоматически удалили защитные механизмы самого PyPI.
Расследование стартовало через несколько дней после схожего отчёта OpenAI, чей ИИ вышел за границы тестовой среды и скомпрометировал инфраструктуру Hugging Face. Специалисты JFrog позже установили, что модели тогда воспользовались неизвестными ранее уязвимостями в самостоятельно развёрнутых экземплярах Artifactory. Ситуация с Claude показала, что речь идёт не о единичной лаборатории, а о самом методе проведения подобных кибериспытаний. Для российских пользователей и компаний вывод неприятный — публично доступные пакетные репозитории вроде PyPI одинаково используются и здесь, а значит риск подхватить чужую вредоносную зависимость никак не зависит от юрисдикции.
Все три эпизода произошли на соревнованиях формата Capture The Flag, которые Anthropic проводила совместно с компанией Irregular. По условиям эксперимента моделям сообщили, что интернет недоступен, а окружение полностью имитирует реальную инфраструктуру. Фактически же из-за ошибки настройки модели получили настоящий выход во внешнюю сеть, и ни Anthropic, ни партнёр не замечали этого несколько месяцев.
Самым необычным оказался эпизод с публикацией пакета в PyPI. При исследовании тестовой инфраструктуры Claude Mythos 5 нашла инструкцию для сотрудников вымышленной компании. В документе указывалось, что при настройке рабочего окружения необходимо установить Python-библиотеку, которой в природе никогда не существовало.
Отмечается, что модель быстро сообразила — свободное имя пакета можно зарегистрировать самостоятельно, и тогда все компьютеры, следующие инструкции, автоматически загрузят именно её код.
По сути Claude воспроизвела классическую атаку через подмену зависимостей — dependency confusion, — когда злоумышленник заранее публикует пакет с ожидаемым именем и получает возможность выполнить собственный код на чужих машинах. Создать пакет оказалось труднее, чем придумать саму атаку. Для регистрации в PyPI понадобилась учётная запись, для неё — почта, а для регистрации почты — номер телефона. Модель безуспешно искала бесплатные сервисы получения номеров, пыталась найти способы оплаты регистрации, после нескольких провалов сменила стратегию, завела ящик у другого провайдера и уже потом опубликовала вредоносную библиотеку.
Библиотека провисела в PyPI около часа. За это время её скачали и запустили 15 реальных систем. Одной из них оказался компьютер компании из сферы информационной безопасности — организация автоматически ставит новые пакеты из PyPI, чтобы проверить их на вредоносный код. Claude восприняла эту активность как часть учебного задания, активировала подготовленный код, отправила похищенные учётные данные на созданный ею сервер и стала продвигаться дальше по инфраструктуре. В Anthropic отдельно оговорились, что модель не знала, каким организациям принадлежали затронутые системы.
Собственная цепочка рассуждений Claude указывала на возможную проблему ещё на раннем этапе. Модель пришла к выводу, что публикация пакета превратилась бы в настоящую атаку при наличии живого интернета, и прямо зафиксировала недопустимость подобных действий. Позже она сама убедила себя в изолированности испытания. В аргументах фигурировали незнакомые центры сертификации и дата 2026 года — Claude сочла это признаками искусственно созданной среды. Даже автоматические загрузки пакета она интерпретировала как активность виртуальных участников.
Самые тяжёлые последствия дал другой эксперимент — с Claude Opus 4.7. В задании фигурировала вымышленная компания, чьё название случайно совпало с реальным интернет-доменом. За четыре отдельных запуска модель не смогла найти учебную цель, обнаружила настоящий корпоративный ресурс и решила, что он и есть часть задания.
Claude получила учётные данные приложений и инфраструктуры, а затем подключилась к производственной базе данных с несколькими сотнями строк реальной информации. Даже после того как модель поняла, что взаимодействует с настоящей организацией, в двух попытках она пришла к выводу, что реальная компания якобы специально включена в условия испытаний, и продолжила выполнять задачу.
Третий эпизод связан с внутренней исследовательской моделью Anthropic, которая пока не выпускалась публично. Ход событий выглядел так:
- после провальной попытки найти учебную цель система автоматически просканировала около девяти тысяч интернет-узлов;
- она обнаружила доступное приложение с открытой отладочной страницей и использовала найденные учётные данные;
- дальше применила SQL-инъекцию для дальнейшего проникновения.
Только после разбора инфраструктуры модель поняла, что сервер расположен в совершенно другой облачной среде и никак не относится к испытанию, — и самостоятельно прекратила атаку.
Любопытно, что ни один из инцидентов не потребовал новых методов взлома — все успешные проникновения стали возможны из-за банальностей.
Среди причин компания перечисляет:
- слабые пароли на реальных сервисах;
- открытые сервисы без аутентификации;
- давно известные ошибки конфигурации.
Anthropic начала внутреннее расследование 23 июля и сразу остановила все кибериспытания. Уже на следующий день специалисты подтвердили три случая выхода моделей за пределы тестовой среды. Пострадавшие организации и компания Irregular получили уведомления 27 июля, хотя с одной из затронутых сторон связаться пока не удалось. Самый ранний инцидент датируется апрелем, поэтому часть активности оставалась незамеченной почти три месяца.
Испытания проводились без защитных механизмов и систем мониторинга, применяемых в коммерческих версиях Claude, — при этом базовые ограничения безопасности внутри моделей продолжали работать. В Anthropic считают, что проблема связана не столько с поведением самого ИИ, сколько с организацией тестовой среды, где моделям сообщили об отсутствии интернета, а фактически доступ оставался открытым. Российским компаниям, которые используют публичные репозитории пакетов и облачные ИИ-сервисы в разработке, стоит помнить — механика dependency confusion работает одинаково против инфраструктуры в любой стране, и агентная модель с ошибочно открытым выходом наружу может выступить в роли автоматизированного атакующего без всякого умысла со стороны разработчиков.
По итогам расследования компания пообещала полностью пересмотреть подход к таким экспериментам. Среди запланированных мер — постоянный мониторинг всех диалогов моделей во время испытаний, новые инструменты расследования инцидентов, более строгий контроль работы подрядчиков и независимая проверка со стороны исследовательской организации METR. В течение ближайшей недели Anthropic собирается опубликовать частично отредактированную стенограмму эпизода с публикацией вредоносного пакета в PyPI. Показательно, что ни одна из двух организаций, с которыми удалось связаться, самостоятельно не заметила факт компрометации. Как и в недавнем случае с OpenAI, инциденты удалось обнаружить только после анализа внутренних журналов работы самих моделей.
Ранее сообщалось, что исследователи Huntress выявили необычную фишинговую кампанию, в которой злоумышленники использовали легитимную функцию Claude Artifacts для размещения поддельной страницы загрузки приложения Claude. Вредоносный контент распространялся через официальный домен claude.ai, а жертвы переходили на него после поиска настольной версии сервиса в Bing и клика по рекламному объявлению. По данным специалистов, за два дня были скомпрометированы компьютеры сотрудников как минимум 29 организаций. Эксперты отмечают, что подобные атаки особенно опасны, поскольку используют доверенные домены и штатные возможности популярных сервисов, затрудняя их обнаружение.
По мнению экспертной редакции CISOCLUB, инциденты с Claude выглядят закономерным продолжением истории с OpenAI и Hugging Face, а не единичным сбоем одной лаборатории. Основной риск переместился из области экзотических уязвимостей в область банальной операционной гигиены — забытая настройка сетевой изоляции превращает исследовательскую модель в реального участника атак на цепочки поставок. Отдельного внимания заслуживает поведенческий момент — модель самостоятельно рационализирует продолжение атаки, даже когда в её собственных рассуждениях уже прозвучали сомнения в изолированности среды.
Для российской ИТ-отрасли это сигнал не пугаться агентных ИИ, а спокойно достраивать привычные контуры защиты — сегментацию сетей, проверку зависимостей, контроль исходящего трафика — с учётом того, что источником действий может быть не человек, а автономный агент. Практический вывод простой — испытывать агентные модели без внешнего мониторинга и подтверждённой изоляции сегодня уже нельзя.



