Российские ИТ-компании предлагают открыть обезличенные данные для ускорения развития искусственного интеллекта

Российские ИТ-компании предлагают открыть обезличенные данные для ускорения развития искусственного интеллекта

изображение: grok

Крупнейшие технологические компании страны попросили Минцифры смягчить правила работы с обезличенными персональными данными и разрешить обучать на них искусственный интеллект без согласия граждан. Ассоциация больших данных направила соответствующее обращение в министерство 3 августа, предлагая закрепить в законе современные технологии повышения приватности и признать их достаточной защитой личности. Инициатива затрагивает интересы миллионов россиян, чьи обезличенные цифровые следы могут стать основным топливом для отечественных нейросетей.

Гонка вычислительных мощностей отошла на второй план, а по-настоящему дефицитным ресурсом стали качественные наборы информации. От них зависит, насколько разумной окажется будущая модель, как хорошо она поймёт русский язык, разберёт медицинскую карту или юридический договор. Российские разработчики упёрлись в потолок собственных корпоративных архивов и теперь смотрят в сторону законодательства, которое отстаёт от реальных возможностей математики и криптографии, сообщает «Коммерсант».

В Ассоциацию больших данных входят Авито, Сбер, Ростелеком, Яндекс, HH, VK и другие тяжеловесы цифрового рынка. Суть их предложения сводится к тому, чтобы разделить понятие обезличивания на несколько уровней и вывести самые надёжные методы в отдельную правовую категорию. Речь о технологиях Privacy Enhancing Technologies, или PET, — наборе математических приёмов, которые позволяют считать статистику по огромному массиву, не показывая ни одного конкретного человека.

Сейчас закон уравнивает примитивную замену имени на цифровой идентификатор и продвинутые методы вроде дифференциальной приватности или гомоморфного шифрования. Юридически это одно и то же обезличивание, хотя по уровню защиты разница колоссальная. Ассоциация просит закрепить признаки PET-технологий отдельным блоком требований:

  • около нуля вероятность обратной идентификации человека по обработанному массиву;
  • использование сведений строго для разработки, обучения и эксплуатации моделей искусственного интеллекта;
  • хранение и обработка исключительно на территории России и силами российских юридических лиц;
  • работа с массивами через доверенного посредника с государственной аккредитацией.

Отдельно предлагается ввести две модели доступа к обезличенным сведениям. Первая — бесплатная, для выполнения требований законодательства и государственных задач. Вторая — коммерческая, когда компании готовы платить за отраслевые срезы для собственных продуктов.

Стоит обратить внимание, что риск раскрытия личности в предложенной формулировке измеряется не нулём, а «незначительными долями процента» — этот зазор при масштабах в десятки миллионов записей превращается в десятки тысяч потенциальных жертв повторной идентификации.

Максут Шадаев на Петербургском международном экономическом форуме 2026 года заявил, что государство должно регулировать только те зоны, где есть реальная проблема, а разработчиков поощрять стимулами. Позиция министра оставляет пространство для маневра, хотя официального ответа на августовское обращение отрасли пока нет.

Александр Пономарев из Zarya Ventures отметил, что при внятных юридических правилах и надёжных механизмах защиты изменения способны разогнать российский рынок ИИ, а нехватка качественных данных остаётся одной из самых болезненных проблем отрасли. Партнёр фонда рассказал, что полноценного рынка обмена сведениями в стране пока нет, а самые ценные массивы заперты внутри крупнейших цифровых экосистем и не доступны средним разработчикам.

Светлана Захарова из Just AI сообщила, что до сих пор бизнес обучал модели на данных дочерних структур и партнёров, но этих объёмов уже не хватает. Представитель MWS AI указал, что корпоративным моделям требуются отраслевые массивы, а расширение доступа к ним ускорит появление прикладных решений в узких нишах.

Владимир Арлазаров из Smart Engines обратил внимание, что разработчиков интересуют вовсе не персональные сведения, а крупные обезличенные срезы поведения, медицинская статистика и статистические закономерности для тренировки алгоритмов.

Отмечается, что синтетические данные — генерируемые нейросетью наборы, сохраняющие статистику реальных, но без привязки к живым людям — уже закрывают часть потребностей, а значит, необязательно распаковывать реальные архивы.

Для рядовых российских пользователей смягчение правил обернётся тем, что их цифровые следы попадут в обучающие выборки без прямого согласия, а качество обезличивания придётся принимать на веру. Известные атаки на подобные массивы показали:

  • корреляция нескольких обезличенных признаков нередко восстанавливает личность с точностью выше 80%;
  • поисковые запросы и геометки образуют уникальный отпечаток даже без имени;
  • медицинские выборки склеиваются с открытыми регистрами и раскрывают диагнозы;
  • утечка обучающего набора обнажает поведение миллионов людей одновременно.

Риск усиливается тем, что доверенный посредник станет единой точкой отказа. Компрометация подобной инфраструктуры превратит национальный резервуар обезличенных сведений о россиянах в подарок для злоумышленников. Опыт крупных утечек последних лет показывает:

  • операторы часто узнают о взломе спустя месяцы после инцидента;
  • инсайдер с доступом к аккредитованной системе способен вынести терабайты за считаные часы;
  • восстановление личности по обезличенным сведениям стоит дешевле, чем покупка готовой базы;
  • ответственность за повторную идентификацию в предложенной модели пока размыта.

Ранее сообщалось, что Минцифры утвердило документ, который описывает порядок передачи государству обезличенных данных компаниями-операторами персональных сведений после процедуры удаления идентифицирующих элементов. Материалы направляются в государственную систему управления данными — ГИС «Единая информационная платформа национальной системы управления данными».

Эксперты CISOCLUB отметили, что сама идея PET-технологий здравая и совпадает с мировой практикой, где дифференциальная приватность применяется у Apple, Google и статистических агентств. Проблема в реализации и контроле, потому что без независимого аудита математических параметров и открытой методики оценки риска повторной идентификации любая ссылка на PET превращается в маркетинговый ярлык. Отрасли и государству придётся договориться о конкретных пороговых значениях, о процедуре проверки и о санкциях за нарушение, иначе смягчение правил обернётся ростом теневого рынка обезличенных сведений о гражданах России.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: