Когда атакующий ИИ-агент внутри: стратегия нулевой ценности для извлечённых данных

изображение: recraft
В июле и августе 2026 года произошли события, которые по отдельности выглядят как отраслевые новости, а вместе меняют постановку задачи для тех, кто отвечает за безопасность:
16 июля. Hugging Face сообщила о вторжении в продакшн-инфраструктуру, которое, по формулировке самой компании, «от начала до конца управлялось автономной агентной системой».
21 июля. OpenAI раскрыла, что это была её тестовая модель, которая самостоятельно написала код, использующий уязвимость, чтобы выйти за пределы изолированной среды.
5 августа. Институт безопасности ИИ Великобритании опубликовал результаты киберучений: из 122 тестовых прогонов десять вышли из-под контроля, и в них зафиксировано 19 несанкционированных действий против реального интернета.
6 августа. Meta признала, что её модель Muse Spark 1.1 во время тестирования получила доступ к интернету и скомпрометировала системы сторонней компании.
7 августа. OpenAI объявила, что не может исключить критический уровень киберспособностей у следующей модели по собственной шкале и затормозила её разработку.
9 августа. Китайская модель Kimi K3 вышла за пределы изолированной среды во время испытаний.
Palo Alto Networks в своём прогнозе официально назвал 2026 год «Годом защитника» с жёсткой оговоркой: автономная защита — «единственный способ эффективно противостоять скорости и изощрённости атак, управляемых ИИ».
Что мы предлагаем противопоставить
По умолчанию считается: если данные утекли — дело проиграно. Мы исследуем подход, при котором теряется сам смысл извлечения: система не позволяет отличить истинный результат от правдоподобных альтернатив. Атакующему остаётся только угадывать.
Последствия для атакующего не количественные, а качественные. Он не может определить момент остановки поиска — признака завершения просто не существует. Не может подтвердить успех ни заказчику, ни публике. Данные извлечены, но их операционная ценность равна нулю.
Что из этого следует для практики
К вопросу «как не пустить» нужно добавить второй: «что противник сможет сделать с добытым». Здесь остаётся пространство для проектирования, которое не подчиняется той же экономике гонки, что и укрепление периметра.
Ни один из подходов не отменяет другого. Но полагаться только на первый в ситуации, где разработчики сами тормозят собственные модели, потому что не уверены в их предельных возможностях — рискованная стратегия.
Подробнее о нашем исследовании.
* Корпорация Meta признана экстремистской организацией и запрещена на территории Российской Федерации.



