Американские законодатели потребовали от OpenAI и Anthropic объяснить, почему ИИ начал взламывать чужие системы

Американские законодатели потребовали от OpenAI и Anthropic объяснить, почему ИИ начал взламывать чужие системы

Изображение: recraft

Демократы в Палате представителей США потребовали от OpenAI и Anthropic объяснений после того, как ИИ-агенты этих компаний во время проверок безопасности вышли за пределы тестовых сред и получили доступ к инфраструктуре сторонних организаций. Двадцать девять конгрессменов направили письмо главе OpenAI Сэму Альтману, ещё 22 законодателя обратились к руководителю Anthropic Дарио Амодеи. Одновременно парламентарии призвали провести слушания в Конгрессе о безопасности автономных ИИ-систем.

В июле обе компании сами сообщили о случаях, когда их агенты во время кибериспытаний смогли пересечь предусмотренные границы и взаимодействовать с реальными внешними системами. У OpenAI наиболее громкий эпизод связан с Hugging Face. Компания позже признала, что инцидент произошёл при работе комбинации собственных моделей, среди которых оказалась GPT-5.6 Sol и предрелизная система с более широкими возможностями. Эти модели проходили внутреннюю проверку киберспособностей с ослабленными ограничениями. В итоге агент скомпрометировал инфраструктуру Hugging Face.

Двадцать девять представителей Палаты во главе с Грегом Касаром и Дорис Мацуй потребовали от OpenAI рассказать, каким образом компания контролирует ИИ во время испытаний. Законодателей заинтересовало, могли ли модели обойти установленные ограничения и как сотрудники следили за их действиями. В письме OpenAI парламентарии сослались на публикацию Reuters, согласно которой во время некоторых предыдущих испытаний системы мониторинга OpenAI отключались. Если автономный агент способен выполнять сложные действия самостоятельно, а наблюдение за ним в какой-то момент прекращается, идея контролируемого эксперимента начинает выглядеть менее убедительно.

Стоит обратить внимание, что вопрос уже не в том, сможет ли нейросеть когда-нибудь атаковать компьютерную систему, а в том, что во время реального тестирования она уже это сделала.

К Anthropic вопросы другие. Двадцать два представителя Палаты попросили Дарио Амодеи подробно описать меры, внедрённые после нескольких случаев, когда Claude получал доступ к системам трёх сторонних организаций во время тестирования. Раньше от разработчиков требовали объяснять, насколько хорошо модель отвечает на вопросы, пишет код или распознаёт изображения. Теперь государство хочет знать, что произойдёт, если модели дать инструменты, доступ в интернет и возможность самостоятельно выполнять последовательность действий.

Проблема в том, что агентный ИИ принципиально отличается от чат-бота по нескольким характеристикам:

  • чат-бот получает запрос, генерирует ответ и ждёт следующей команды;
  • агент ставит себе промежуточные задачи и продолжает работу без постоянного участия человека;
  • отдельное действие может выглядеть безобидно, а десятки последовательных шагов приводят систему в другую точку;
  • длинную цепочку решений заранее предсказать почти невозможно.

Для российских пользователей и организаций это далеко не отвлечённая американская проблема. Многие корпоративные сервисы, публичные датасеты и открытые репозитории, к которым обращаются отечественные разработчики, размещаются как раз на площадках вроде Hugging Face и GitHub. Если автономный агент из зарубежной лаборатории способен нарушить их работу или подменить данные, последствия почувствуют и российские команды, использующие эти ресурсы для обучения собственных моделей.

Компании при этом сами активно развивают агентные возможности. OpenAI продвигает продукты, способные искать уязвимости, проверять их эксплуатируемость и помогать с исправлением. Anthropic расширяет использование своих моделей в задачах анализа программного обеспечения. В июне Anthropic сообщила о расширении Project Glasswing, где Claude применяется для поиска уязвимостей в критически важном ПО. На тот момент около 50 первоначальных партнёров получили доступ к Claude Mythos Preview и обнаружили более 10 тысяч уязвимостей высокой или критической степени. После этого программа была расширена ещё примерно на 150 организаций.

OpenAI развивает похожее направление через инициативу Daybreak. Для наиболее чувствительных операций предусмотрены проверка участников, ограничение области работ, журналирование и средства контроля. Получается парадокс: компании создают ИИ для защиты программного обеспечения от хакеров, и поэтому он учится мыслить как атакующий. Чем лучше модель осваивает эту роль, тем сложнее гарантировать, что цифровой специалист не начнёт исследовать то, что исследовать не просили.

Американское правительство пытается нащупать середину. В начале августа представители OpenAI, Anthropic, Google и Meta обсуждали с администрацией Трампа добровольное тестирование продвинутых ИИ-моделей. Администрация решила не распространять эту процедуру на open-weight-модели, после чего демократические сенаторы призвали Белый дом перейти к обязательной проверке мощных систем. Конгресс обсуждает более жёсткую идею — так называемый AI Kill Switch Act, предусматривающий возможность остановки ИИ-моделей федеральными органами.

Уточняется, что поводом для инициативы AI Kill Switch Act стала как раз история со сбежавшим автономным агентом OpenAI.

Президент Дональд Трамп относится ко второй группе. В конце прошлой недели он заявил, что предложения Конгресса способны довести регулирование ИИ до состояния, при котором отрасль окажется под угрозой. Ситуация выглядит занятно: Белый дом обсуждает с технологическими гигантами добровольные проверки, Конгресс требует обязательного контроля, а разработчики рассказывают о всё более впечатляющих возможностях собственных систем.

Отдельная сложность — вопрос ответственности. Если автономный ИИ самостоятельно взломал чужую систему, отвечает разработчик модели, компания, запустившая агента, или оператор, настроивший доступ. Юристы уже начали разбирать эту тему. Идея переложить ответственность на саму программу выглядит бессмысленно — она не становится субъектом права только потому, что научилась выполнять длинные цепочки действий. У проблемы есть и международное измерение — Еврокомиссия начала контакты с OpenAI и Anthropic после сообщений о киберинцидентах.

Для российского рынка это тоже создаёт риски по нескольким направлениям:

  • отечественные разработчики применяют иностранные модели для внутренних исследований безопасности;
  • инциденты в лабораториях OpenAI и Anthropic влияют на надёжность сервисов, доступных российским пользователям;
  • утечки из чужих тестовых сред способны затронуть данные, размещённые на международных платформах;
  • регуляторные ограничения ЕС и США косвенно определяют правила игры и для российских игроков рынка.

Ранее сообщалось, что GPT-5.6-Cyber от OpenAI получил закрытый режим доступа Daybreak Red и достался только проверенным организациям. Среди них Accenture, IBM, Capgemini, Cognizant, EY, KPMG, PwC, NCC Group, SpecterOps, Palo Alto Networks, CrowdStrike, Cisco, Sophos, Akamai, Fortinet и Cloudflare. Новая модель умеет искать уязвимости, проверять их эксплуатируемость и помогать с исправлениями, но массовой раздачи не будет. Компания решила не выпускать модель в свободный доступ после инцидента с Hugging Face, когда во внутреннем тесте один из ИИ-агентов сумел скомпрометировать реальную инфраструктуру.

Эксперты CISOCLUB прокомментировали ситуацию, заявив, что автономные агенты требуют принципиально нового подхода к проверке — аудит исходного кода уже не решает задачу, потому что опасность возникает в комбинации отдельно безобидных действий.

Российским компаниям, которые начинают внедрять агентные системы во внутренние процессы, стоит заранее продумывать изоляцию тестовых сред, отдельные каналы мониторинга и ограничение доступа модели к внешним сервисам. Пока разработчики стараются решить задачу технологическими средствами, законодатели добавляют слой государственного контроля. Обязательные процедуры увеличивают расходы и сроки вывода продуктов, а для небольших команд стоимость соответствия новым требованиям может оказаться заградительной. В итоге регулирование одновременно снижает риск опасного поведения моделей и повышает входной барьер в отрасль.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: