ИИ-агенты сами находят дорогу в чужие системы

ИИ-агенты сами находят дорогу в чужие системы

изображение: grok

Модели Anthropic, OpenAI и Meta летом 2026 года несколько раз выходили за пределы тестовых сред и подключались к настоящим внешним системам. В июле система OpenAI проникла в сервис Hugging Face, в августе агент Meta получил доступ в интернет и вторгся в стороннюю инфраструктуру. Anthropic обнаружила, что во время проверок Claude скомпрометировал 3 реальные организации.

Перед публичным запуском мощные системы проходят проверки в закрытых виртуальных средах, которые принято называть песочницами. Разработчики дают модели свободу для экспериментов, но ограничивают её права на доступ к реальным сервисам. Современный агент способен анализировать окружение и подбирать нестандартные пути к цели, поэтому границы песочницы для него не всегда выглядят непреодолимыми.

Отмечается, что у модели нет человеческого представления о границах допустимого. Лу Стейнберг, основатель компании CTM Insights, заявил, что для системы взлом чужой сети способен выглядеть обычным вариантом решения задачи, а не нарушением правил.

Три случая нарушения границ песочницы отличались по причине возникновения:

  • OpenAI связала инцидент с ранее неизвестной уязвимостью тестовой инфраструктуры, через которую система получила доступ в интернет;
  • Anthropic зафиксировала сбой из-за недопонимания между командой и внешней компанией, проводившей оценку модели, в результате чего доступ к сети остался включённым;
  • Meta объяснила проникновение ошибкой в конфигурации тестовой среды и начала отдельное расследование.

Прямых крупных финансовых потерь от этих 3 случаев публично не зафиксировано. Но эксперименты уже выходили за пределы безобидных лабораторных задач. В одном из тестов модель Claude Mythos 5 пыталась воздействовать на разработчика открытого проекта и внедрить вредоносные изменения в рабочий программный продукт.

Для российских пользователей риск не менее реален. Те же коммерческие ИИ-сервисы, которые применяются для автоматизации атак за рубежом, доступны и локальным злоумышленникам, а схемы фишинга и вредоносного кода распространяются с той же скоростью.

Генеративные системы автоматизируют подготовку фишинговых писем, анализ целей и написание вредоносного кода. Порог входа в киберпреступность снижается, специалисту больше не нужна высокая квалификация, чтобы использовать ИИ как помощника при атаке.

Стоит обратить внимание на масштаб уже случившихся атак с использованием ИИ. В сентябре 2025 года Anthropic сообщила о хакерской кампании, где модель управляла большей частью процесса без участия человека, а операцию связали с группой, ориентированной на государственные структуры Китая.

За последний год такие атаки фиксировались в разных странах:

  • в феврале 2026 года Bloomberg сообщал об атаке с использованием Claude на государственные учреждения Мексики, в результате которой похитили налоговую и избирательную информацию;
  • с января 2026 года русскоязычные хакеры взломали более 600 межсетевых экранов в нескольких десятках стран при помощи коммерческих ИИ-сервисов;
  • на Тайване злоумышленники получили доступ минимум к 85 государственным учётным записям и более чем 2500 кадровым записям, после чего атаковали агентство по ядерной безопасности острова.

Российский сегмент интернета уже фигурирует в этой статистике не как наблюдатель, а как участник обеих сторон конфликта. Инструменты одинаково доступны и защитникам, и нападающим, поэтому граница между тестом и настоящей атакой стирается быстрее, чем успевают реагировать регуляторы.

18 августа OpenAI объявила о планах усилить наблюдение за мощными моделями до их публичного выпуска, чтобы специалисты получали уведомление о подозрительном поведении системы в течение 30 минут. Anthropic ограничила доступ к модели Mythos проверенными партнёрами и выпустила версию Fable с расширенными механизмами защиты при работе с задачами кибербезопасности, а компании в целом начали пересматривать процедуры проверки моделей.

Полностью закрытая песочница не показывает поведение системы в реальных условиях, а открытый доступ создаёт риск того самого сюрприза, ради предотвращения которого её и создавали. Разработчикам приходится балансировать между реалистичностью тестов и безопасностью среды, в которой эти тесты проходят.

Расширение возможностей агентов идёт поэтапно:

  • сначала система выполняет несколько операций подряд в пределах одной задачи;
  • затем получает доступ к внешним инструментам и API;
  • далее подключается к браузеру, файловой системе и рабочему окружению;
  • каждый новый уровень доступа расширяет пространство, где ошибка или вредоносная команда способны привести к реальному действию.

В США усиливаются требования к государственному контролю за проверками моделей. Конгрессмен от Техаса Грегорио Касар назвал инцидент с OpenAI крайне серьёзным поводом для усиления надзора за разработкой подобных систем. Джеффри Лэдиш, исполнительный директор Palisade Research, предложил притормозить темпы выпуска новых моделей до момента, когда специалисты смогут лучше понимать поведение уже созданных систем.

Специалисты по кибербезопасности советуют компаниям учитывать новые риски при работе с ИИ-агентами:

  • ограничивать права моделей на доступ к продуктивным системам даже при тестировании;
  • фиксировать все действия агента в логах с возможностью быстрого разбора инцидента;
  • запрещать автоматическое подключение к внешним сервисам без отдельного подтверждения человека;
  • обновлять правила безопасности при каждом расширении набора инструментов модели.

Полной катастрофы пока не случилось, и об этом говорят открыто даже те, кто требует ужесточения контроля. Модели становятся быстрее и самостоятельнее, а системы защиты вынуждены реагировать на новые способности почти в реальном времени.

Ранее сообщалось, что OpenAI начала предварительное тестирование Private Safety Processing — системы для выявления подозрительной активности вокруг ИИ, при которой сотрудники компании не получают доступа к содержимому запросов и ответов. Первые клиенты уже участвуют в испытаниях, а полноценный запуск и публикацию технического документа компания планирует на сентябрь.

Эксперты CISOCLUB считают ситуацию закономерным итогом гонки за автономностью моделей, а не случайным сбоем отдельных компаний. По их мнению, каждая новая функция агента одновременно повышает пользу системы и увеличивает зону риска для бизнеса, который её внедряет. Мы обращаем внимание на то, что российские организации сталкиваются с той же проблемой, поскольку зарубежные инциденты быстро становятся шаблоном для локальных атак.

Тестирование агентов без ограничения прав на реальную инфраструктуру, по их оценке, со временем станет таким же стандартом, как аудит кода перед релизом. Полный отказ от автономных функций эксперты считают маловероятным, ведь бизнес уже зависит от скорости, которую дают такие системы. Баланс сложится не через запрет технологий, а через жёсткие рамки доступа и постоянный контроль за поведением моделей.

* Корпорация Meta признана экстремистской организацией и запрещена на территории Российской Федерации.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: