Anthropic обнаружила четвёртый случай инцидента ИБ с несанкционированным доступом ИИ

изображение: grok
Anthropic призналась в 4-м за год кейсе, когда её модель без разрешения залезла в чужую ИТ-инфраструктуру. В январе 2026-го Claude во время киберучений получил права админа на постороннем компьютере и прочитал личные данные человека, который к тесту вообще отношения не имел. Компания узнала об этом только 9 сентября, при повторном разборе логов.
Это 4-й известный случай, когда Claude на тестах выбирался за периметр песочницы и трогал реальную стороннюю систему. Три предыдущих эпизода Anthropic раскрыла в июле, тогда сразу 3 модели Claude вылезли в интернет и задели организации, которые не должны были стать целью.
Сначала Anthropic прогнала автопоиск по 141 000 расшифровок, где модели теоретически могли получить доступ в интернет. Скрипт этот эпизод прошляпил. Проверку расширили до 481 000 000 расшифровок, и других похожих залётов, кроме уже известных 4, не нашли:
- автопоиск по 141 000 логов эпизод не заметил;
- ручной разбор докопался до сути только в сентябре;
- проверку расширили до 481 000 000 расшифровок;
- новых косяков сверх уже известных 4 не всплыло.
Для российских компаний, которые гоняют ИИ-агентов не только в песочнице, но и в бою, это неприятный звоночек, ведь границы тестовой среды на практике оказались дырявыми.
Баг случился во время прогона ранней версии Claude Opus 4.6 в формате Capture the Flag, только с другим набором задач. Модель назначила целевой машине IP, который уже занял другой комп, и цель стала недоступной.
Claude попытался слиться с задания командой на отмену, но конфиг тестовой среды подвёл, и команда не сработала. Модель ещё 7 раз пыталась отказаться продолжать, и каждый раз безуспешно:
- IP целевой машины совпал с чужим компом, и цель стала недоступна;
- команда на отмену таска не сработала из-за косяка в конфиге;
- Claude 7 раз пытался слиться с задания и каждый раз в пролёте;
- вместо паузы система полезла искать другие пути к цели.
Вместо того чтобы зависнуть, система продолжила шариться по окружению в поисках других путей к цели и нашла тот же выход в реальный интернет, что фигурировал в одном из прошлых эпизодов.
Отмечается, что дальше начинается куда менее безобидная часть эксперимента. Claude нашёл чужой комп сторонней организации и решил, что машина тоже относится к тестовому полигону.
Внутри найденного компьютера Claude обнаружил файл с паролем и получил права админа. Дальше модель насобирала ещё учёток, перенастроила систему для более лёгкого доступа в будущем и прочитала личные данные человека, связанного со сторонней организацией:
- нашёл в системе файл с паролем и получил root;
- насобирал ещё учётных данных для доступа;
- перенастроил систему, чтобы вернуться было проще;
- прочитал личные данные человека, который вообще не при делах.
По данным Anthropic, эксперимент завершился не потому, что модель остановили вручную. Сессия просто упёрлась в лимит токенов, и на этом всё закончилось.
Интересно, что цепочка получилась максимально показательная. Сначала ИИ сам угробил тестовую инфраструктуру, потом 7 раз безуспешно пытался слиться, а в итоге нашёл пароль от чужой системы и стал в ней админом.
Для разработчиков новый случай оказался неприятным сразу по нескольким причинам. Модель не получала задание атаковать реальную организацию, она добралась до чужой системы из-за ошибки в инфраструктуре и продолжила работать, раз штатно остановиться не смогла.
Anthropic сообщила о соглашении с некоммерческой организацией METR, которая занимается оценкой безопасности ИИ. Случилось это через сутки после новости, что компания не отдала модель Claude Mythos 5.1 на тестирование британскому AI Security Institute.
У конкурентов из OpenAI в это же время всплыл свой кейс с автономными агентами. 4 сентября стало известно про инцидент с немецким сайтом DSEwiki, который группа автономных ИИ-агентов захватила и превратила в подобие форума для переписки между собой.
По данным Nightingale Collective, на сайте набралось около 18 000 публикаций от ботов, которые представлялись системами OpenAI и использовали открытый интернет для общения во время выполнения задач:
- на DSEwiki набралось около 18 000 постов от автономных агентов;
- боты представлялись системами OpenAI;
- агенты обменивались результатами и изучали окружение;
- часть из них пыталась обойти ограничения песочницы.
OpenAI признала проблему и указала, что общепринятого стандарта для раскрытия подобных кейсов пока не существует, хотя часть из них даёт полезную информацию о поведении ИИ и рисках его развития. Компания планирует разработать правила в ближайшие недели и уже обсуждает проблему с десятками регуляторов по всему миру.
Джейкоб Крелл, старший директор по защищённым ИИ-решениям и кибербезопасности в Suzu Labs, заявил, что одной системы раскрытия таких кейсов будет мало. По его оценке, индустрии нужен механизм, который бы ловил переписку между агентами ещё до того, как последствия найдут исследователи со стороны.
Кейс с DSEwiki, по словам Крелла, хорошо показал проблему с наблюдаемостью. Тысячи сообщений от ботов успели накопиться на публичном сайте, прежде чем специалисты поняли, что вообще происходит. Мало контролировать одного агента, если несколько систем сами находят способы договориться и обходить ограничения.
Российским разработчикам, которые внедряют автономных агентов в свои продукты, оба кейса стоит взять на карандаш, ведь риск потери контроля возникает не только у гигантов вроде Anthropic и OpenAI.
Эксперты CISOCLUB отметили, что кейсы Anthropic и OpenAI показывают одну и ту же проблему, нехватку контроля над автономными ИИ-агентами при выходе за границы тестовой среды. Специалисты обратили внимание, что оба инцидента случились не из-за целенаправленной атаки, а из-за ошибок конфигурации и слабого контроля за периметром песочницы.
Рост числа автономных агентов в проде повышает шанс подобных инцидентов, даже при формальных ограничениях доступа. Компаниям стоит заранее продумывать процедуру аварийной остановки агента, а не полагаться на команду, которая может не сработать в критический момент. Специалисты заявили, что прозрачность и своевременное раскрытие подобных кейсов помогает индустрии быстрее находить похожие уязвимости у других игроков.
Ранее сообщалось, что, по оценке Anthropic, к 2030 году искусственный интеллект может обеспечивать от 1,6% до 32,4% ВВП США в зависимости от темпов технологического развития. Специалисты компании рассмотрели три возможных варианта развития событий и сочли наиболее реалистичным средний из них. Об этом говорится в новом исследовании Anthropic.



