Российские ИТ-компании предлагают открыть обезличенные данные для ускорения развития искусственного интеллекта

изображение: grok
Крупнейшие технологические компании страны попросили Минцифры смягчить правила работы с обезличенными персональными данными и разрешить обучать на них искусственный интеллект без согласия граждан. Ассоциация больших данных направила соответствующее обращение в министерство 3 августа, предлагая закрепить в законе современные технологии повышения приватности и признать их достаточной защитой личности. Инициатива затрагивает интересы миллионов россиян, чьи обезличенные цифровые следы могут стать основным топливом для отечественных нейросетей.
Гонка вычислительных мощностей отошла на второй план, а по-настоящему дефицитным ресурсом стали качественные наборы информации. От них зависит, насколько разумной окажется будущая модель, как хорошо она поймёт русский язык, разберёт медицинскую карту или юридический договор. Российские разработчики упёрлись в потолок собственных корпоративных архивов и теперь смотрят в сторону законодательства, которое отстаёт от реальных возможностей математики и криптографии, сообщает «Коммерсант».
В Ассоциацию больших данных входят Авито, Сбер, Ростелеком, Яндекс, HH, VK и другие тяжеловесы цифрового рынка. Суть их предложения сводится к тому, чтобы разделить понятие обезличивания на несколько уровней и вывести самые надёжные методы в отдельную правовую категорию. Речь о технологиях Privacy Enhancing Technologies, или PET, — наборе математических приёмов, которые позволяют считать статистику по огромному массиву, не показывая ни одного конкретного человека.
Сейчас закон уравнивает примитивную замену имени на цифровой идентификатор и продвинутые методы вроде дифференциальной приватности или гомоморфного шифрования. Юридически это одно и то же обезличивание, хотя по уровню защиты разница колоссальная. Ассоциация просит закрепить признаки PET-технологий отдельным блоком требований:
- около нуля вероятность обратной идентификации человека по обработанному массиву;
- использование сведений строго для разработки, обучения и эксплуатации моделей искусственного интеллекта;
- хранение и обработка исключительно на территории России и силами российских юридических лиц;
- работа с массивами через доверенного посредника с государственной аккредитацией.
Отдельно предлагается ввести две модели доступа к обезличенным сведениям. Первая — бесплатная, для выполнения требований законодательства и государственных задач. Вторая — коммерческая, когда компании готовы платить за отраслевые срезы для собственных продуктов.
Стоит обратить внимание, что риск раскрытия личности в предложенной формулировке измеряется не нулём, а «незначительными долями процента» — этот зазор при масштабах в десятки миллионов записей превращается в десятки тысяч потенциальных жертв повторной идентификации.
Максут Шадаев на Петербургском международном экономическом форуме 2026 года заявил, что государство должно регулировать только те зоны, где есть реальная проблема, а разработчиков поощрять стимулами. Позиция министра оставляет пространство для маневра, хотя официального ответа на августовское обращение отрасли пока нет.
Александр Пономарев из Zarya Ventures отметил, что при внятных юридических правилах и надёжных механизмах защиты изменения способны разогнать российский рынок ИИ, а нехватка качественных данных остаётся одной из самых болезненных проблем отрасли. Партнёр фонда рассказал, что полноценного рынка обмена сведениями в стране пока нет, а самые ценные массивы заперты внутри крупнейших цифровых экосистем и не доступны средним разработчикам.
Светлана Захарова из Just AI сообщила, что до сих пор бизнес обучал модели на данных дочерних структур и партнёров, но этих объёмов уже не хватает. Представитель MWS AI указал, что корпоративным моделям требуются отраслевые массивы, а расширение доступа к ним ускорит появление прикладных решений в узких нишах.
Владимир Арлазаров из Smart Engines обратил внимание, что разработчиков интересуют вовсе не персональные сведения, а крупные обезличенные срезы поведения, медицинская статистика и статистические закономерности для тренировки алгоритмов.
Отмечается, что синтетические данные — генерируемые нейросетью наборы, сохраняющие статистику реальных, но без привязки к живым людям — уже закрывают часть потребностей, а значит, необязательно распаковывать реальные архивы.
Для рядовых российских пользователей смягчение правил обернётся тем, что их цифровые следы попадут в обучающие выборки без прямого согласия, а качество обезличивания придётся принимать на веру. Известные атаки на подобные массивы показали:
- корреляция нескольких обезличенных признаков нередко восстанавливает личность с точностью выше 80%;
- поисковые запросы и геометки образуют уникальный отпечаток даже без имени;
- медицинские выборки склеиваются с открытыми регистрами и раскрывают диагнозы;
- утечка обучающего набора обнажает поведение миллионов людей одновременно.
Риск усиливается тем, что доверенный посредник станет единой точкой отказа. Компрометация подобной инфраструктуры превратит национальный резервуар обезличенных сведений о россиянах в подарок для злоумышленников. Опыт крупных утечек последних лет показывает:
- операторы часто узнают о взломе спустя месяцы после инцидента;
- инсайдер с доступом к аккредитованной системе способен вынести терабайты за считаные часы;
- восстановление личности по обезличенным сведениям стоит дешевле, чем покупка готовой базы;
- ответственность за повторную идентификацию в предложенной модели пока размыта.
Ранее сообщалось, что Минцифры утвердило документ, который описывает порядок передачи государству обезличенных данных компаниями-операторами персональных сведений после процедуры удаления идентифицирующих элементов. Материалы направляются в государственную систему управления данными — ГИС «Единая информационная платформа национальной системы управления данными».
Эксперты CISOCLUB отметили, что сама идея PET-технологий здравая и совпадает с мировой практикой, где дифференциальная приватность применяется у Apple, Google и статистических агентств. Проблема в реализации и контроле, потому что без независимого аудита математических параметров и открытой методики оценки риска повторной идентификации любая ссылка на PET превращается в маркетинговый ярлык. Отрасли и государству придётся договориться о конкретных пороговых значениях, о процедуре проверки и о санкциях за нарушение, иначе смягчение правил обернётся ростом теневого рынка обезличенных сведений о гражданах России.



