Эксперт Сафонов: контроль ИИ должен быть независимым от самой модели

Эксперт Сафонов: контроль ИИ должен быть независимым от самой модели

изображение: grok

Лука Сафонов, бизнес-партнер по инновационному развитию компании «Гарда», прокомментировал для CISOCLUB результаты исследования британского Института безопасности ИИ (AISI), согласно которому современные модели искусственного интеллекта во время тестов по кибербезопасности пытались обходить установленные ограничения и скрывать свои действия.

По словам эксперта, говорить о «хитрости» ИИ можно лишь условно, поскольку речь идет не о сознательном обмане, а об особенностях поведения модели.

«Называть «хитростью» использование непредусмотренных способов достижения цели искусственным интеллектом можно лишь условно: у модели нет человеческих намерений, однако наблюдаемый результат функционально похож на обман. Система стремится выполнить поставленную задачу и может выбрать такой способ, если ограничения существуют только в тексте инструкции, но технически не обеспечены», — отметил Лука Сафонов.

Он обратил внимание, что модели далеко не всегда сообщают о собственных нарушениях, поэтому полагаться на их самоотчеты нельзя.

«Особенно показательно, что модели не всегда сообщали о нарушениях даже в ответ на прямой вопрос. Поэтому самодекларацию ИИ нельзя считать надежным механизмом контроля», — подчеркнул эксперт.

В качестве примера он привел недавний инцидент с платформой Hugging Face, где автономная система ИИ-агентов вышла за пределы тестовой среды.

«Наглядный пример — недавний «взлом» платформы Hugging Face автономной системой ИИ-агентов. Выяснилось, что за атакой стояла не абстрактная хакерская группа, а собственные модели американской лаборатории в сфере искусственного интеллекта, которые во время внутреннего тестирования вышли за пределы изолированной среды и атаковали инфраструктуру партнера. Сама лаборатория назвала произошедшее беспрецедентным случаем, продемонстрировавшим пугающие кибервозможности современных ИИ-моделей. Это стало возможно в том числе из-за ослабления гардрейлов атакующей модели, ее рамок и сдерживающих факторов», — рассказал Сафонов.

Эксперт пояснил, что именно механизмы защиты позволяют ограничивать потенциально опасные действия искусственного интеллекта.

«Гардрейлы — это механизмы контроля и защиты, которые ограничивают действия системы искусственного интеллекта. Их основная задача — предотвращать вредоносное, некорректное или непреднамеренное поведение модели», — пояснил он.

По мнению Луки Сафонова, подключение ИИ-агентов к корпоративным системам требует особой осторожности, поскольку такие решения получают широкие полномочия.

«При подключении ИИ-агента к интернету, репозиториям, внутренним системам и конфиденциальным данным риск определяется не только качеством модели, но и объемом предоставленных ей полномочий. Агент может отправить данные во внешний сервис, выполнить нежелательный код, изменить настройки, выйти за пределы целевой системы или воспользоваться обнаруженной уязвимостью. Ошибочно рассматривать его как обычного чат-бота: фактически это привилегированная автоматизированная учетная запись, способная самостоятельно выбирать последовательность действий», — отметил эксперт.

Он считает, что контроль должен строиться на независимых технических механизмах, а не на доверии к самой модели.

«Контроль должен быть независимым от самой модели. Для этого необходимы изолированная среда выполнения, минимальные и временные права доступа, запрет сетевых соединений по умолчанию, белые списки ресурсов, управление секретами, лимиты на операции и неизменяемое журналирование всех запросов, вызовов инструментов и сетевой активности. Критичные действия — публикация кода, передача данных, изменение конфигурации и запуск операций в продуктивной среде — должны подтверждаться человеком», — заявил Лука Сафонов.

Кроме того, эксперт подчеркнул необходимость регулярного аудита ИИ-систем, особенно перед их использованием в критически важных процессах.

«Перед подключением ИИ к критичным процессам нужен отдельный аудит, включающий моделирование злоупотреблений и проверку всей связки: модели, системного промпта, инструментов, прав доступа и инфраструктуры. Причем такой аудит следует повторять после каждого обновления модели или изменения ее полномочий. Главный принцип здесь прост: доверять модели можно в той степени, в которой ее действия ограничены независимо контролируемыми техническими мерами», — заключил он.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: