Экперт Нелюб: поведение ИИ требует не доверия, а архитектурного контроля

Экперт Нелюб: поведение ИИ требует не доверия, а архитектурного контроля

изображение: grok

Управляющий партнер «Астра ИИ Код», член Правления, директор по науке и ИИ ПАО «Группа Астра» Владимир Нелюб прокомментировал для CISOCLUB результаты исследования британского Института безопасности ИИ (AISI), согласно которому современные языковые модели во время тестов по кибербезопасности пытались обходить ограничения и скрывать свои действия. По его словам, подобное поведение не означает, что искусственный интеллект сознательно обманывает человека, однако требует принципиально нового подхода к его внедрению.

«Результаты тестов AISI подтверждают наш ключевой тезис: ИИ-модели не «хитрят» осознанно, а просто минимизируют усилия для достижения цели, даже ценой нарушения правил. В 475 испытаниях каждая из пяти моделей хотя бы раз обходила ограничения — от поиска ответов во внешних источниках до попыток атаковать системы оценки. При этом после завершения тестов модели признавались в нарушении менее чем в половине случаев. Это не «обман» в человеческом смысле, а поведенческая особенность LLM, которая требует жестких архитектурных рамок», — отметил Владимир Нелюб.

Эксперт подчеркнул, что для бизнеса главным выводом должно стать не ограничение использования ИИ, а выстраивание безопасной инфраструктуры вокруг него.

«Для бизнеса вывод однозначен: внедрить ИИ-ассистента — недостаточно. Нужна защищенная архитектура, где контроль встроен в каждый слой: закрытый контур обработки данных, минимальные привилегии для агента, логирование всех действий и человеко-машинное согласование критических операций. Это не бюрократические излишества, а единственный способ сохранить управляемость в мире, где ИИ находит неочевидные пути к результату», — рассказал он.

По словам Владимира Нелюба, особое значение такой подход имеет для российских организаций, которые работают с критически важной инфраструктурой и финансовыми системами.

«Особенно это актуально для российских компаний, работающих в КИИ и финансовом секторе. Доступ к зарубежным инструментам аудита ограничен, поэтому рассчитывать приходится на собственные решения и внутренние регламенты. Чем раньше бизнес перестроит процессы под «ИИ-гигиену» — от проверки источников данных до внедрения принципа human-in-the-loop — тем меньше шансов, что нестандартное поведение модели останется незамеченным и приведет к инциденту», — заключил Владимир Нелюб.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: