Государство хочет скинуться на датасеты, на которых будут расти российские нейросети

Государство хочет скинуться на датасеты, на которых будут расти российские нейросети

изображение: grok

Минцифры и бизнес обсуждают грантовую поддержку для создания датасетов, на которых обучаются крупные ИИ-модели. Деньги планируют выделять на русскоязычные и отраслевые наборы данных, которыми одновременно смогут пользоваться сразу несколько исследовательских команд. Финальный механизм финансирования ведомство и участники рынка рассчитывают согласовать до 30 сентября 2026 года.

10 сентября тему обсуждали на заседании рабочей группы «Меры поддержки ИИ», куда собрались представители правительства, госкорпораций и бизнеса. По данным «Коммерсанта», участники встречи рассказали о подготовке этой меры.

Качественный датасет для крупной модели это не папка с файлами, которую слили в общий чат и разошлись. Команде приходится пройти цикл из пяти шагов:

  • собрать исходные материалы из разных источников;
  • очистить их от дублей и мусора;
  • разметить данные под конкретную задачу;
  • проверить лицензии и права на использование;
  • прогнать результат через обучение и посмотреть, годится ли он для работы.

Общий отраслевой датасет позволяет нескольким командам работать с одной базой вместо того, чтобы каждая колхозила похожий набор с нуля.

Отмечается, что один общий датасет способен закрыть потребности сразу нескольких лабораторий, которым иначе пришлось бы дублировать одну и ту же работу.

Одних датасетов для развития отечественных ИИ-систем мало, даже если их будет вагон и маленькая тележка. Участники обсуждения называют три условия:

  • вычислительные мощности для обучения моделей;
  • квалифицированные специалисты по данным и ML;
  • инфраструктура, на которой обученные модели потом запускают и обслуживают.

Деньги на всё это выделяют не с потолка. Работа идёт в рамках 243-ФЗ «О поддержке развития технологий искусственного интеллекта». Совокупный объём господдержки направления оценивают в 71,7 млрд руб. Среди инструментов также числятся льготные кредиты и лизинг серверов и GPU для обучения моделей.

От скорости запуска этой схемы напрямую зависит, получат ли российские пользователи более быстрые и более локализованные нейросетевые сервисы, а не очередной адаптированный зарубежный движок.

Конкретного ценника у инициативы пока нет, и это не от чьей-то забывчивости. Итоговые расходы зависят от 4 вещей:

  • доступности исходных данных и условий их использования;
  • объёма нужной очистки и подготовки;
  • количества материала, который придётся размечать вручную;
  • необходимости привлекать отраслевых экспертов для сложных тем.

Представитель вице-премьера Дмитрия Григоренко сообщил, что работа над мерами продолжается, а итоговые решения ещё не приняты. Минцифры подтвердило обсуждение инициативы и уточнило, что после межведомственного согласования предстоит определить правила участия, объём финансирования, размеры субсидий и грантов, а также сроки программы. «Коммерсантъ» также запросил комментарии у Сбербанка и «Яндекса», а VK и Т-Банк, как обычно, предпочли отмолчаться.

Руководитель направления «Разрешение IT&IP споров» компании «Рустам Курмаев и партнёры» Ярослав Шицле пояснил, что обычно применяют два механизма:

  • конкурс, где проекты сравнивают между собой и отбирают лучшие;
  • запрос предложений, когда деньги получают все заявители, подошедшие под требования, в порядке очереди.

По оценке Ярослава Шицле, гранты на особо значимые проекты обычно составляют от 100 млн до 2 млрд руб. При схеме с софинансированием, похожей на модель Фонда содействия инновациям, верхняя планка может составить около 30 млн руб при обязательном вкладе получателя не менее 20%. Для ИИ-проектов доля государства при отдельных мерах поддержки может доходить до 80%.

Интересно, что в отдельных случаях государство готово закрыть до 80% стоимости ИИ-проекта, а бизнес отделается сравнительно скромным чеком.

Гендиректор Ivideon Заур Абуталимов рассказал, что стандартный заказной проект компании в сфере видеоаналитики занимает 4-5 месяцев, и до 80% этого срока уходит не на саму ИИ-систему, а на возню с данными, которые собирают, приводят в порядок, размечают и проверяют. Подготовка датасета, по его словам, стоит от 1 млн до нескольких десятков млн руб в зависимости от задачи, и это только подготовительный этап, после которого данные ещё должны подтвердить свою пригодность при обучении модели.

Алексей Ершов, замдиректора НОЦ ФНС России и МГТУ им. Н.Э. Баумана, оценил создание действительно качественного датасета в десятки экспериментальных обучений и сотни тысяч GPU-часов. Такой объём вычислений по карману далеко не каждой команде, а скорее исследовательским лабораториям высокого уровня.

Алексей Ершов отметил, что нужно заранее определить условия дальнейшего использования готовых датасетов. Без требований к публикации или доступности наборов данных финансирование рискует осесть у крупнейших игроков, а материалы, созданные за государственные деньги, могут остаться в чьём-то закрытом хранилище и не дойти до более широкого круга российских разработчиков и пользователей.

Эксперты CISOCLUB считают инициативу логичным шагом для рынка, где данные давно стали таким же дефицитным ресурсом, как видеокарты в разгар майнингового бума. Общий датасет реально экономит деньги и время команд, которым иначе пришлось бы собирать похожие наборы с нуля. Риск в том, что без чётких правил доступа к результатам вся выгода осядет у нескольких крупных игроков, а остальной рынок так и останется без нормальных данных для обучения. Поэтому итоговый успех программы будет зависеть не столько от суммы гранта, сколько от прозрачности условий и открытости готовых датасетов. Если Минцифры пропишет понятные правила публикации и доступа, шанс на массовый эффект для отрасли вполне реален.

Ранее сообщалось, что правительство обсуждает требование, по которому компании должны будут выбирать российские модели искусственного интеллекта даже в тех случаях, когда импортные или open-source решения стоят дешевле. Согласно проекту постановления, перейти на иностранную нейросеть разрешат только при условии, что она дешевле отечественной минимум в полтора раза. Инициативу представил «Сбер» на рабочей группе по регулированию ИИ.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных