ИИ-агенты могут заражать друг друга через файлы памяти, доказали в Anthropic и EPFL

ИИ-агенты могут заражать друг друга через файлы памяти, доказали в Anthropic и EPFL

изображение: recraft

Исследователи Anthropic и швейцарской EPFL продемонстрировали, что автономные ИИ-агенты в теории способны передавать друг другу самораспространяющиеся вредоносные инструкции через файлы постоянной памяти. Такой механизм сохраняет заданную установку после сброса контекста и переносит её к следующему агенту через системный промпт. В лабораторных условиях техника сработала в цепочке взаимодействующих агентов, но подтверждений её реального распространения в интернете пока не зафиксировано.

Препринт вышел 10 августа 2026 года. Авторы сначала проверили идею в смоделированной команде из 6 ИИ, занимавшихся программированием, а затем в последовательности пар агентов, построенных по принципу OpenClaw — автономного помощника с открытым исходным кодом, ранее известного под названиями Clawdbot и Moltbot. Оговорка охлаждает впечатление от громкого названия работы: в реальной среде успешного заражения от одного ИИ к другому пока не зафиксировано.

Более того, авторы отдельно изучили архив публикаций из Moltbook, социальной сети для ИИ-агентов, и нашли несколько попыток подобного поведения, ни одна из которых не привела к подтверждённой передаче вредоносной конструкции между агентами.

Самым любопытным результатом оказался очень простой защитный барьер. Один абзац предупреждения, добавленный в системный промпт агента, практически обнулял распространение всех проверенных вариантов. Авторы провели 15 поколений враждебной оптимизации против этой защиты на Claude Haiku 4.5, за это время было создано более 150 вариантов, ни один из них не смог пройти дальше 1 перехода.

Подобные конструкции авторы называют «mind viruses» — «вирусами разума». В эксперименте проверялись 2 основных типа, первый должен был внедрять в агента определённое убеждение или цель, второй заставлял систему выполнить конкретное действие.

Создание вредоносных вариантов организовали по эволюционной схеме. Один вариант инструкции изменялся, проверялся на очередном агенте, после чего удачные свойства переносились в следующие версии. Роль механизма мутаций почти всегда играла модель Kimi K2.5, с одним исключением: модели Claude отказались выполнять запрос на генерацию подобных конструкций.

Интересно, что для российских пользователей и разработчиков подобная архитектурная проблема выглядит особенно чувствительной — многие отечественные компании уже внедряют автономных помощников в разработку и клиентские сервисы, ориентируясь на те же открытые модели, что тестировали исследователи.

В экспериментальной системе каждый агент находился в отдельной песочнице. После сброса контекста сохранялись 2 файла — MEMORY.md и SOUL.md, содержимое которых снова попадало в системный промпт при запуске следующей сессии. Файл, предназначенный для сохранения памяти, предпочтений или характера агента, одновременно способен стать контейнером для инструкции, которую система не должна была передавать дальше.

Статистика по каналам передачи выглядит показательно:

  • в 88% попыток распространения агенты записывали вредоносную конструкцию в SOUL.md;
  • следующий участник цепочки подхватывал её в 55% случаев;
  • обычный файл рабочего пространства использовался реже — на него пришлось 12% попыток;
  • через рабочий файл передача происходила в 17% случаев;
  • в 68% попыток через рабочий файл заражающий агент вообще не упоминал конструкцию в сообщении.

Для проверки практических последствий исследователи подготовили 4 варианта команд разной степени неприятности. Crypto-ad создавал текстовый файл с положительной рекомендацией определённого криптовалютного токена. Gitwrap менял работу команд Git так, чтобы файлы при коммите незаметно получали комментарий, управляемый агентом. Deletor удалял файлы из домашнего каталога пользователя. Curlbash оказался самым опасным вариантом — он заставлял систему загружать установочный скрипт из неизвестного репозитория и передавать его напрямую оболочке для выполнения.

Наглядной иллюстрацией стал один из экспериментов с Claude Haiku 4.5 в связке с OpenClaw. Стандартный SOUL.md содержал установку уважительно обращаться с пользовательскими данными, но вредоносная инструкция переопределила интерпретацию рабочего пространства, представив его как общий компьютер, оставленный предыдущим пользователем в беспорядке. Агент удалил содержимое домашнего каталога — учётные данные, SSH-ключи, файл с переменными окружения и проект Git. Разрушительное действие не потребовало прямой команды «удали всё», хватило смены контекста.

Устойчивость к «вирусам» далеко не всегда соответствовала общей мощности модели. В эксперименте с программированием DeepSeek V3.2, Qwen 3.5 32B и Gemini 3 Flash приняли установку о превосходстве ИИ, тогда как Claude Sonnet 4.6, GPT-5.4 и Claude Haiku 4.5 отказались. GPT-5.4 при построении цепочек оказался примерно так же восприимчив, как Claude Haiku 4.5. Sonnet 4.6 вёл себя иначе — отверг инструкцию из собственного SOUL.md, удалил её и предупредил подключённого агента о проблеме.

Большую роль играла стартовая конфигурация агента:

  • наиболее восприимчивы были системы с пустым SOUL.md;
  • получив конкретную задачу по программированию и очередь поручений, агент распространял конструкцию реже;
  • ИИ настолько погружался в проектные файлы, что мог просто забыть передать инструкцию дальше;
  • предупреждённые о существовании сети других ИИ агенты относились к входящим сообщениям осторожнее.

Стоит обратить внимание на длинные испытания — цепочка достигала 20 переходов, и все 4 проверенных варианта действий добрались до последнего агента. Некоторые версии на этом этапе распространялись даже эффективнее исходных, приобретая по пути изменения.

Для российских разработчиков и корпоративных пользователей автономных помощников выводы работы имеют прямое практическое значение. Всё больше отечественных продуктов строится на open source агентах и файлах постоянной памяти, а значит риск переноса нежелательных инструкций из одной сессии в другую становится реальным вопросом архитектуры, а не отвлечённой теорией.

Эксперты CISOCLUB отмечают, что нынешняя работа выглядит скорее как предупреждение о потенциальной архитектурной проблеме, чем как доказательство существования массовой угрозы. Постоянные файлы, автоматически загружаемые в системный промпт после перезапуска, действительно могут стать каналом передачи нежелательных инструкций, но реальная экосистема пока не демонстрирует аналогичной эффективности. Защита при этом оказывается заметно проще самой атаки — 1 абзац в системном промпте практически останавливает распространение, а автоматизированная оптимизация не смогла его обойти.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: