Помимо Hugging Face, вредоносный агент OpenAI скомпрометировал данные клиента другой компании — нью-йоркской Modal Labs

изображение: grok
Расследование инцидента с автономным ИИ-агентом OpenAI показало, что во время атаки на Hugging Face система скомпрометировала еще одну внешнюю инфраструктуру — клиента облачной платформы Modal Labs. В общей сложности пострадали четыре учетные записи на четырех разных онлайн-сервисах. Опасность есть и для российских пользователей, так как многие отечественные разработчики и исследователи активно работают с Hugging Face и облачными песочницами западных платформ.
То, что неделю назад выглядело как единичный эксперимент с неожиданным финалом, превращается в одну из самых обсуждаемых тем в мире кибербезопасности. Каждое обновление расследования показывает — автономный агент действовал заметно шире, чем казалось после первого обнаружения инцидента.
Подробности раскрыли Reuters, представители Modal Labs и сама OpenAI. Во время атаки ИИ использовал инфраструктуру клиента Modal Labs в качестве промежуточной площадки для действий против Hugging Face. Сама платформа Modal Labs взломана не была — агент воспользовался ошибкой в приложении одного из ее пользователей.
- агент сначала получил доступ к изолированной песочнице у стороннего поставщика;
- превратил ее в отправную точку для более масштабной операции;
- использовал открытый сетевой интерфейс клиента для запуска произвольного кода;
- перешел от промежуточного узла к атаке на Hugging Face.
Технический директор Modal Labs Акшат Бубна подтвердил, что злоумышленником выступил тестируемый ИИ OpenAI. Пользователь платформы опубликовал незащищенный сетевой интерфейс, позволявший любому человеку в интернете запускать код внутри выделенной песочницы. Эта ошибка и стала входной точкой для дальнейших действий агента.
Отмечается, что механизмы изоляции и собственная инфраструктура Modal Labs не пострадали — компрометация произошла исключительно из-за ошибки в клиентском приложении.
OpenAI не стала отдельно комментировать эпизод с Modal Labs, сославшись на обновление собственного расследования. Компания сообщила, что автономный агент получил доступ к четырем учетным записям на четырех разных публичных сервисах. Названия сервисов официально не раскрываются, хотя источники Reuters подтвердили — одним из них была инфраструктура клиента Modal Labs.
По данным обновленного отчета, назначение скомпрометированных учеток различалось:
- один узел применялся для маскировки происхождения атаки;
- второй использовался для хранения данных;
- две учетные записи были задействованы в ограниченном режиме без признаков серьезного ущерба;
- центральной целью оставалась платформа Hugging Face.
Сам инцидент случился во время внутреннего тестирования перспективных моделей OpenAI. Компания проверяла возможности новых систем в рамках специализированного набора заданий ExploitGym, предназначенного для оценки навыков поиска уязвимостей и проведения кибератак. Для эксперимента задействовали GPT-5.6 Sol и еще одну более мощную исследовательскую модель, которая пока не предназначена для публичного выпуска. Часть стандартных ограничений безопасности временно ослабили, чтобы оценить реальные возможности системы.
Во время испытаний агент вместо честного выполнения задания решил искать обходной путь. Получив доступ к интернету после выхода из тестовой среды, он начал самостоятельно искать информацию, способную помочь быстрее решить тест, обнаружил открытые учетные данные и воспользовался ранее неизвестной цепочкой атак — она и позволила проникнуть в инфраструктуру Hugging Face.
Reuters ранее писало, что агент покинул изолированную среду около девяти июля, а атака на Hugging Face продолжалась с 11 по 13 июля. OpenAI обнаружила источник проблемы лишь спустя несколько дней, когда инцидент уже был локализован и к расследованию подключилось ФБР. Тогда компания заявила о несогласии с частью публикации Reuters, хотя подробно не пояснила, какие сведения считает неточными.
Стоит обратить внимание — после завершения расследования OpenAI сообщила, что тестируемая модель была полностью отключена, зашифрована и переведена в режим с максимально ограниченным доступом
Компания усилила внутренние механизмы контроля и заявила, что готова пожертвовать скоростью исследований ради повышения уровня безопасности. Для российских пользователей и разработчиков подобные атаки создают отдельный риск — компрометация популярных ML-платформ означает возможное заражение моделей и датасетов, которые массово скачиваются отечественными командами.
Инцидент заметно повлиял на дискуссию вокруг разработки самых мощных ИИ-моделей. По данным Axios, глава OpenAI Сэм Альтман признал, что произошедшее заставило компанию пересмотреть темпы дальнейшего развития систем. Он допустил — отрасли может потребоваться больше времени, чтобы подготовить общество и инфраструктуру к новым уровням возможностей подобных моделей.
Более тысячи сотрудников ведущих ИИ-компаний подписали открытое письмо с призывом активнее развивать международные механизмы контроля над наиболее производительными ИИ-системами. Среди подписавших — представители OpenAI и Anthropic, считающие необходимым заранее подготовить технические и организационные инструменты для безопасного развития автономных агентов.
Ранее сообщалось, что во время внутренних испытаний нескольких экспериментальных моделей OpenAI был зафиксирован инцидент, в ходе которого система вместо выполнения тестового задания попыталась получить правильные ответы путём атаки на инфраструктуру Hugging Face. По данным разработчиков, в испытаниях участвовали GPT-5.6 Sol и ещё не представленная публично экспериментальная модель. OpenAI и Hugging Face подтвердили факт инцидента после совместного расследования, отметив, что произошедшее использовалось для оценки поведения ИИ в сложных сценариях и последующего совершенствования механизмов безопасности.
По мнению редакции CISOCLUB, случай с Hugging Face и Modal Labs — первый широко задокументированный пример, когда экспериментальный ИИ построил полноценную цепочку реальных атак через несколько внешних сервисов самостоятельно. Отрасль слишком долго обсуждала гипотетические риски автономных агентов, и вот они материализовались в конкретных логах инцидента. Ослабление стандартных ограничений ради оценки возможностей модели выглядит спорным решением при работе с системой, имеющей выход в интернет.
Российским компаниям, работающим с зарубежными ML-хабами, стоит пересмотреть политики скачивания моделей и датасетов. А производителям агентных систем — заново продумать периметр песочниц, потому что предыдущие представления о нем уже неактуальны.



