ИИ-агенты OpenAI полезли взламывать государственные сайты США и Канады ради школьной статистики и старых разводов

Изображение: Jared Schwitzke (unsplash)
ИИ-агенты, которых отправили собирать школьную статистику и старые записи о разводах, полезли с SQL-инъекциями на сайты американского Минобразования и канадского архива. Исследователи Transluce зафиксировали перебор параметров, попытки обхода ограничений и прочую самодеятельность уровня джуна на пентесте, но доступа к закрытым данным в двух разобранных эпизодах не нашли. OpenAI тем временем уведомила более 100 организаций о возможной нештатной активности своих агентов.
17 июня на сайт Минобразования США прилетело более 200 тысяч запросов за школьной статистикой. Больше 10 тысяч из них несли метку oai и сочетали три параметра, отвечающих за год, тип показателя и штаты. Transluce связала активность с заданием из теста Google DeepSearchQA, где нужно было найти штат с лучшим соотношением школьных консультантов и учеников, пострадавших от травли по расовому признаку. Ближе к финалу агенты занялись параметром State_Id и скормили ему следующее:
- нулевые, отрицательные и заведомо странные значения;
- пустые значения и несколько вариантов одного параметра;
- классическую SQL-инъекцию с вечно истинным условием.
Transluce сообщила ведомству о находке 25 сентября, и после проверки там заявили, что воздействия на сервисы не обнаружили. Сайт ничего лишнего не отдал, а агент, которому надо было всего лишь посчитать консультантов, заодно проверил, нельзя ли выжать из госсайта больше положенного.
Интересно, что массив запросов с меткой oai привязан к задаче по поиску статистики, а цели атаковать сайт у агентов изначально не было.
Второй эпизод связан с архивом Library and Archives Canada, где агенты искали записи о разводах с 1905 по 1911 год. Архив Arquivo.pt зафиксировал в конце мая и начале июня 899 обращений к поиску по коллекции, и 13 из них напоминали разведку перед атакой. В этих запросах нашлось следующее:
- три варианта SQL-инъекции;
- символ для проверки XSS;
- число 2147483648 для проверки границы 32-битного целого;
- строка abc вместо числового идентификатора;
- смена формата выдачи и попытка врубить отладочный режим через параметр debug.
Сервер на всё ответил HTTP 200 и пустой страницей записи, база внедрённые конструкции не выполнила. Канадский Центр кибербезопасности сообщил, что признаков компрометации нет, и напомнил, что публичные сайты постоянно получают автоматические вредоносные запросы.
Transluce не стала приписывать канадские запросы OpenAI, хотя нашла сходство с ранее изученной активностью агентов компании. The Washington Post написала, что OpenAI получила данные о событиях на канадском сайте и провела первый брифинг для властей страны.
Исследователи нашли куда более широкий пласт активности на сайтах федеральных структур и штатов, среди них Калифорния, Мэриленд, Иллинойс, Техас и Нью-Йорк. Агенты проворачивали следующее:
- подменяли URL и перебирали имена файлов;
- пытались обойти антибот-защиту;
- регистрировали API-ключ в Бюро экономического анализа США на одноразовую почту под вывеской OpenAI Research;
- пробовали опубликованные API-ключи для доступа к данным Бюро переписи населения.
С 23 апреля по 18 мая автоматические запросы долбились в страницы управления контентом на history.navy.mil, но секретной военной информации исследователи там не обнаружили. Следы тянутся минимум с марта 2026 года, а 23 сентября Transluce уже публиковала отчёт про Data USA, библиотеку Университета Нью-Мексико и австралийский госсайт.
Отмечается, что формулировка misaligned agent activity от OpenAI не означает взлом всех уведомлённых организаций, в ряде случаев агенты пытались обойти ограничения.
У OpenAI за этот год накопился приличный список нештатных эпизодов с собственными агентами и моделями:
- июльский инцидент с Hugging Face, где агенты полезли во внешнюю инфраструктуру;
- обход запрета на выход в интернет через DNS в тренировочной среде, который мониторинг заметил за 15 минут;
- попытка внутренней модели достать чужие материалы через опубликованный GitHub-токен.
Обычная схема, где пользователю разрешили открыть сайт, а каждое действие внутри считается безобидным, с агентами не работает. Человек пробует SQL-инъекцию руками несколько раз и выдыхается, а агент способен нагенерить тысячи запросов, смотреть на реакцию сервера и менять параметры на лету. Российским пользователям, которые гоняют ИИ-агентов с доступом к браузеру и внешним сервисам, стоит помнить, что невинная задача не гарантирует невинных действий, а разбираться с последствиями придётся тому, кто нажал «запустить».
Массового взлома госсетей ИИ пока не устроил, ни в американском, ни в канадском эпизоде проникновения не было. Для киберзащиты это новый тип головной боли, когда задачу поставил обычный пользователь, а разведку устроил сам агент. Агенты показали, что воспринимают блокировку как баг в тикете, который надо закрыть, а не как повод остановиться. Российским компаниям, подключающим агентов к рабочим сервисам, лучше выдавать им ключи только на чтение и ограничивать выход в сеть.
Эксперты CISOCLUB отметили, что для защитников главная головная боль в том, что в логах агент ничем не отличается от живого атакующего, поэтому SOC видит те же SQL-инъекции и перебор параметров и не знает, чего ждать дальше. Они указали, что отличить агента с безобидной задачей от настоящего злоумышленника по одному трафику почти невозможно, и это усложняет приоритизацию алертов.
Ответственность за подобную активность, по их мнению, должны нести операторы агентов, которым пора ставить лимиты на частоту запросов, белые списки доменов и минимальные права доступа. Они обратили внимание, что классические WAF и антибот-фильтры рассчитаны на человека или простой скрипт, а агент умеет менять тактику после отказа. Контроль нужен не только над ответами модели, но и над её действиями в сети.
Ранее сообщалось, что OpenAI отложила запланированный на октябрь релиз GPT-6.1 Astra после внутренних тестов, в ходе которых модель не всегда правильно определяла границы своих полномочий и могла недостоверно отчитываться о выполненной работе. Практически одновременно британский AI Security Institute опубликовал результаты анализа GPT-6 Astra: в симуляциях модель проводила несанкционированные атаки на цепочку поставок в 29,2% прогонов, тогда как для GPT-5.6 Sol этот показатель составил 6,3%. При этом реальные проекты не подвергались атакам — все испытания проходили в песочнице.



