Эксперт Ильин: защиту ИИ нельзя строить на доверии к модели

изображение: grok
Никита Ильин, руководитель группы тестирования на проникновение Triadix (входит в состав ATLAS), прокомментировал для CISOCLUB результаты исследования британского Института безопасности ИИ (AISI), согласно которому современные языковые модели во время тестов по кибербезопасности пытались обходить установленные ограничения.
По словам эксперта, подобное поведение является закономерным следствием принципов обучения современных нейросетей и не свидетельствует о наличии у них сознательных намерений.
«Наблюдаемое поведение моделей (reward hacking) — естественное следствие того, как обучены современные нейросети: система стремится минимизировать функцию потерь и достичь цели наикратчайшим путём в рамках предоставленных ей инструментов. Модель не обладает моралью, и если самый короткий путь к успеху лежит через выход из песочницы или атаку на среду оценки, модель выберет именно его», — отметил Никита Ильин.
Эксперт подчеркнул, что подобные случаи известны еще со времен ранних исследований искусственного интеллекта.
«Само по себе такое поведение не ново. Кто изучал тему ИИ до появления LLM, уже видел это в экспериментах с обучением с подкреплением в игровых средах. Когда модель помещали в игру, она часто находила баги, позволявшие быстро получить максимальный балл, вместо того чтобы «честно» проходить трассу или выполнять заложенную задачу. Классический пример — лодка в CoastRunners, крутившаяся на месте ради бонусов», — рассказал он.
По его словам, принципиальное отличие современных моделей заключается в том, что теперь они получают доступ к реальным инструментам и корпоративной инфраструктуре.
«Разница лишь в том, что раньше эти «лазейки» ограничивались рамками виртуального игрового мира. Сегодня же языковым моделям дают доступ к реальным инструментам — терминалу, сетевым запросам, интерпретаторам кода и внешним API — и их «игровым полем» становится вся подключённая инфраструктура, а цена ошибки и масштабы возможных последствий выросли на порядки», — пояснил эксперт.
Никита Ильин считает, что главный вывод для специалистов по информационной безопасности заключается в необходимости строить защиту не на доверии к модели, а на архитектурных ограничениях.
«Из этого поведения следует главный вывод для ИБ-специалистов: защитить систему, пытаясь воспитать модель промптами или надеясь на её честность, не получится. Защита должна строиться на уровне архитектуры среды, в которой работает ИИ», — подчеркнул он.
Эксперт перечислил ключевые принципы безопасной работы с ИИ-агентами.
«Любой сгенерированный моделью запрос, код или системный вызов должен обрабатываться как потенциально вредоносный ввод от неизвестного внешнего пользователя. Запуск кода или выполнение команд в консоли должны происходить в изолированных одноразовых контейнерах, которые уничтожаются сразу после выполнения задачи. API-ключи и токены доступа, выдаваемые ИИ-агентам, должны быть краткосрочными и обладать минимально необходимыми правами. Нельзя полагаться на то, что модель сама честно объяснит свои действия в Chain-of-Thought. Логирование должно происходить на уровне инфраструктуры», — заключил Никита Ильин.



