Персональные данные россиян отправляют на свидание с искусственным интеллектом

Персональные данные россиян отправляют на свидание с искусственным интеллектом

изображение: grok

Российский бизнес обсуждает с Минэкономразвития и Минцифры запуск экспериментально-правового режима, который откроет разработчикам национальных ИИ-моделей доступ к государственным массивам через закрытую платформу без вывоза данных наружу. Параметры инициативы регуляторам обещают представить к октябрю 2026 года, а первыми участниками станут компании со статусом создателей суверенной нейросети.

Предложение прорабатывалось в начале августа на рабочих группах по искусственному интеллекту. Государственные информационные системы владеют огромными объёмами сведений, пригодных для тренировки отечественных моделей, но их держатели не обязаны отдавать эти материалы бизнесу. Закон о поддержке ИИ уже разрешил обучение на государственных данных без согласия правообладателей, а вот механизма получения массивов до сих пор нет.

Конструкция ЭПР напоминает закрытую лабораторию, а не государственный файлообменник. Компании смогут запускать свои алгоритмы внутри защищённого контура, получать результаты обработки, но исходные массивы физически остаются у владельца:

  • разработчик получает доступ к отраслевой информационной системе;
  • модель обучается внутри инфраструктуры держателя данных;
  • наружу выходят только результаты вычислений, а не сырые записи;
  • контроль за извлечёнными сведениями остаётся у оператора платформы.

Стоит обратить внимание, что режим предполагает временное снятие части ограничений закона о персональных данных, врачебной тайны и отраслевых правил только для узкого круга участников.

Представитель «Т-Технологий» подтвердил участие в обсуждении, «Яндекс» комментировать отказался, «Сбер» на запрос не ответил. Минэкономразвития и Минцифры сообщили, что оформленных предложений по устройству ЭПР пока не поступало. Директор по стратегии ИИ Cloud.ru Дмитрий Юдин напоминает, что действующее регулирование допускает извлечение данных при законном доступе, но не обязывает владельца системы передавать массив разработчику нейросети.

Для рядовых российских пользователей вопрос сводится к тому, чьи персональные записи окажутся внутри обучающих выборок. Ассоциация больших данных с участием «Авито», «Сбера» и «Яндекса» уже просила Минцифры разрешить работу с гражданской информацией без индивидуального согласия — при условии применения технологий повышения приватности. Идея звучит красиво, но риск утечки медицинских карт, финансовых операций или сведений из ведомственных реестров при подобной консолидации массивов не исчезает, а перемещается на оператора закрытого контура.

ML-директор Positive Technologies Андрей Кузнецов обращает внимание, что подготовка датасета часто занимает больше времени, чем само обучение модели. Массив на несколько терабайт автоматически не превращается в качественный обучающий материал — сначала данные приходится очищать, размечать и структурировать. Иначе нейросеть учится не тому, чему от неё ждали, а прикладным задачам могут больше подойти небольшие отраслевые модели с профессиональными выборками.

Экспериментальный режим не отменяет ограничений, установленных федеральным законодательством, — он работает лишь там, где сами законы предусматривают исключения», — говорит руководитель направления «Разрешение IT&IP споров» фирмы «Рустам Курмаев и партнёры» Ярослав Шицле.

Ярослав Шицле указывает и на другой барьер. Без появления прямой обязанности передавать определённые категории сведений эксперимент превратится в добровольную инициативу, где каждая организация сама решает, открывать ли доступ. Обезличенные персональные записи разработчикам можно предоставлять и сейчас, а вот работа с врачебной или иной охраняемой законом тайной потребует точечной правки отраслевых актов.

Для российского пользователя чувствительный момент возникает при обработке медицинских, финансовых и биометрических записей. Даже обезличенные сведения при объединении с внешними источниками поддаются реидентификации — конкретный человек восстанавливается по набору признаков. Если государственные массивы окажутся в едином обучающем контуре без внятных гарантий, компрометация одной модели способна затронуть миллионы граждан:

  • медицинские диагнозы и записи о лечении;
  • банковские транзакции и кредитные истории;
  • сведения из реестров недвижимости и транспорта;
  • данные о занятости и социальных выплатах.

Технологическая сторона тоже требует отдельной работы. Бизнесу нужно запускать собственные алгоритмы внутри государственной инфраструктуры, что поднимает вопросы разграничения полномочий, аудита действий модели и контроля за тем, что нейросеть смогла извлечь из закрытого массива. Оператор платформы фактически становится посредником между держателем сведений и разработчиком, а его ответственность за корректность выгрузки результатов пока нигде не описана.

Уточняется, что первоначальный круг участников ограничат разработчиками национальной или суверенной модели, а расширение состава возможно позднее — за счёт компаний с отраслевыми решениями.

Юридическая рамка требует решения сразу нескольких задач. Регуляторам предстоит определить основания доступа, распределить ответственность между владельцами данных и разработчиками, прописать порядок обезличивания и установить требования к информационной безопасности. Для разных сфер требования будут отличаться, а часть отраслевых законов придётся корректировать отдельно:

  • закон о персональных данных требует чётких оснований работы без согласия;
  • нормы о врачебной тайне ограничивают передачу медицинских сведений;
  • банковская тайна закрывает финансовые операции клиентов;
  • налоговая тайна защищает сведения ФНС.

Ранее сообщалось, что Минцифры убрало из новой редакции «Антифрода 3.0» требование, согласно которому сайты, приложения и информационные системы должны были в течение трех лет хранить сведения о регистрации и авторизации пользователей. Документ уже направили на межведомственное согласование, однако финальный набор мер пока не закреплен. Вместе с требованием о длительном хранении журналов входов из проекта исчезли еще несколько спорных пунктов, касающихся персональных данных и телефонных номеров.

Эксперты CISOCLUB отметили, что предлагаемая конструкция похожа не на пропуск к государственным системам, а на попытку построить отдельный цифровой коридор для узкого круга проектов. Медицинской нейросети нужны медицинские данные, промышленной — производственные, финансовой — банковские массивы, и без доступа к профильным сведениям отраслевые модели останутся недостаточно точными.

Одновременно каждый шаг расширения такого коридора повышает риски для рядовых пользователей, чьи записи оказываются внутри обучающих выборок без прямого согласия. Вопрос лишь в том, получится ли проложить маршрут так, чтобы по нему действительно поехали данные с внятными гарантиями безопасности, а не только разрешительные документы.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: