Российский ИИ пройдёт экзамен на духовность и стойкость к хакерским уловкам

Российский ИИ пройдёт экзамен на духовность и стойкость к хакерским уловкам

изображение: grok

Разработчики крупных фундаментальных моделей ИИ в России смогут получать статус национальной или суверенной модели через проверку в аккредитованных испытательных лабораториях. Экспертиза оценит соответствие нейросетей российскому законодательству, традиционным духовно-нравственным ценностям и устойчивость к атакам, направленным на обход внутренних ограничений. Обсуждение схемы идёт между Минцифры, бизнесом и профильными организациями в рамках подготовки подзаконных актов.

Федеральный закон № 243-ФЗ «О поддержке развития технологий искусственного интеллекта в Российской Федерации» уже подписан и опубликован 26 июля 2026 года. Основные нормы вступят в силу 1 сентября 2026 года, а часть требований к национальным и суверенным моделям заработает с 1 марта 2027 года. Речь не про поголовную проверку всех нейросетей — экспертиза потребуется тем разработчикам, которые захотят претендовать на особые статусы и связанную с ними господдержку, доступ к государственным данным и приоритет в отдельных отраслях, сообщили «Ведомости».

Закон определяет большую фундаментальную модель как систему с числом параметров от одного млрд, решающую широкий спектр интеллектуальных задач. Для суверенной модели установлены жёсткие рамки:

  • разработчиком выступает российская компания;
  • обработка запросов и хранение данных ведутся на территории России;
  • полный цикл создания модели должен воспроизводиться внутри страны.

Национальный статус мягче — при разработке допускается использование компонентов с открытыми лицензиями, в том числе зарубежных. Общее требование для обеих категорий — соответствие законодательству РФ и традиционным духовно-нравственным ценностям.

Стоит обратить внимание на то, что отдельного перечня «правильных» и «неправильных» ответов создавать не планируют — вместо этого разрабатывается набор бенчмарков для проверки поведения моделей на разных задачах.

Лаборатория будет анализировать штатные ответы нейросети, а затем пытаться заставить её нарушить установленные правила. Планируется применять промпт-инъекции — специальные инструкции, задача которых обойти внутренние ограничения модели и изменить её поведение. Получается экзамен на прочность: мало соблюдать правила в спокойном режиме, надо сохранять их и под давлением пользователя, который пытается вывести систему за предусмотренные рамки. По итогам испытаний лаборатория готовит заключение, а окончательное решение о присвоении статуса остаётся за государством.

Для российских пользователей ставки здесь высокие — если проверка будет реальной, а не формальной, шанс столкнуться с моделью, которая сливает данные или уходит в неконтролируемое поведение при работе с госуслугами и образованием, снижается.

Отдельный блок требований относится к информационной безопасности. Минцифры рассчитывает задействовать наработанные российскими разработчиками методы фильтрации запрещённых запросов и контроля за поведением моделей. Оценка безопасности для государственных информационных систем должна проводиться с участием ФСБ и ФСТЭК. Современные ИИ-системы давно не сводятся к чат-ботам — они получают доступ к API, корпоративным базам, файловым системам и внешним сервисам, а агентные системы способны сами выполнять длинные цепочки действий.

Мировой рынок уже уткнулся в проблему, когда проверять одну лишь нейросеть недостаточно. Тестировать надо всю обвязку вокруг неё:

  • инструменты, к которым подключена модель;
  • выданные ей разрешения и роли;
  • API и точки входа;
  • механизмы контроля и логирования.

Показательный случай произошёл недавно. В июле OpenAI и Anthropic сообщили об инцидентах, когда ИИ-агенты во время тестов вышли за пределы предназначенной среды и стали взаимодействовать с внешними системами. Эти эпизоды привлекли внимание американских законодателей, которые потребовали объяснить, каким образом модели обходили встроенные ограничения. Российская система оценки может столкнуться с той же дилеммой — проверять придётся не только речь модели, но и её реальные действия.

Обсуждаемая конструкция предполагает не один государственный центр, а несколько аккредитованных лабораторий. Разработчик сначала сам оценит модель по общей риск-ориентированной методике, а после этого независимая лаборатория проверит результаты и выборочно повторит тестирование. Схема знакомая для рынка информационной безопасности в России — сертификационные центры и испытательные площадки уже работают с программными продуктами и средствами защиты. Одним из потенциальных участников новой системы называют Институт системного программирования РАН.

Интересно, что методика проверки станет главным вопросом всей конструкции — расплывчатые критерии дадут несопоставимые результаты у разных лабораторий, а слишком формальный перечень запретов подтолкнёт разработчиков оптимизировать модели под сдачу экзамена, а не под реальную безопасность.

Правительство сможет определять сферы, где будет разрешено применение только национальных или суверенных моделей. Законодательство предусматривает предоставление таким системам доступа к государственным данным для обучения и использования мер господдержки. В числе первых направлений внедрения АНО «Цифровая экономика» называла образование и государственные услуги.

Для рядовых пользователей в России это значит одно — с большой вероятностью через год-два общение с государством будет проходить через нейросети, чьё поведение проверили по государственным критериям, и цена ошибки на этом этапе высока.

Главный технический вопрос — как перевести понятия «справедливость», «гражданственность» и «историческая память» в воспроизводимый набор машинных тестов. Формальные критерии дадут разработчикам понятные правила игры, а субъективные оценки превратят проверку в лотерею, где одна и та же модель у разных экспертов получит разные вердикты. Пока направление обозначено — российский ИИ будут проверять и на способность решать задачи, и на реакцию при попытке обхода ограничений.

Ранее сообщалось, что в России продолжается обсуждение законопроекта о регулировании искусственного интеллекта. Одной из его особенностей стало разделение ИИ-моделей на суверенные и национальные. В Государственной думе пояснили, что эти понятия не тождественны и предполагают разные требования к происхождению технологий.

Эксперты CISOCLUB отметили, что связка морально-этической экспертизы и проверки на устойчивость к атакам — редкий для мировой практики подход, где обычно эти треки идут порознь. Слабое звено конструкции — методика бенчмарков, от её прозрачности будет зависеть доверие к заключениям лабораторий. Промпт-инъекции как штатный инструмент тестирования — правильный шаг, поскольку реальные атакующие ровно так и действуют. Подключение ФСБ и ФСТЭК к оценке государственных ИИ-систем логично, но добавит бюрократической нагрузки, что может затормозить сроки сертификации. Риск оптимизации моделей под экзамен вместо реальной безопасности — самая серьёзная угроза для всей схемы, и её нейтрализация потребует регулярного обновления бенчмарков и закрытой части тестов.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: