Российский бизнес массово переходит на китайские большие языковые модели

Российский бизнес массово переходит на китайские большие языковые модели, и объёмы их потребления в отечественных облаках выросли в разы за последний год. Qwen, DeepSeek, GLM и Kimi занимают заметную долю ИИ-трафика, вытесняя американские разработки за счёт открытых весов, возможности локального развёртывания и низкой стоимости инференса. Компании выбирают китайские LLM не как компромисс, а как рабочий инструмент для программирования, автоматизации процессов и создания ИИ-агентов.
Данные Yandex AI Studio показывают, что в первом полугодии 2026 года клиенты платформы обработали 597 млрд токенов — в 18 раз больше, чем годом ранее. На модели «Яндекса» пришлось 54% этого объёма, среди зарубежных решений лидирует Qwen с долей 21,2%, DeepSeek занял 13,5%, а американская GPT-OSS — 7,5%. На MWS GPT цифры ещё нагляднее — потребление китайских LLM за шесть месяцев достигло 400 млрд токенов, что в 11 раз превышает показатель за весь 2025 год, сообщает «Коммерсант».
Распределение внутри китайского сегмента на MWS GPT:
- Qwen — 261,1 млрд токенов;
- GLM — 91,2 млрд токенов;
- Kimi — 81,4 млрд токенов, и модель впервые обошла DeepSeek по объёму использования.
Cloud.ru также фиксирует многократный скачок спроса. За неполные восемь месяцев 2026 года потребление LLM выросло примерно в 18 раз, и китайские решения занимают в этом объёме существенную долю. Руководитель Yandex AI Studio Артур Самигуллин сообщил, что потребление опенсорсных китайских моделей за год увеличилось более чем в пять раз — открытые веса позволяют адаптировать модель под корпоративные задачи и запускать её на собственных мощностях.
Стоит обратить внимание, что для российского пользователя переход бизнеса на китайские LLM создаёт неочевидные риски — данные, обработанные через зарубежный API, могут оказаться за пределами отечественного информационного контура, а прозрачность обучения этих моделей остаётся ограниченной.
Разрыв между американскими и китайскими флагманами резко сократился, а стоимость миллиона токенов вышла на первый план для корпоративных заказчиков. При классификации документов, генерации типовых текстов, извлечении данных или работе корпоративного чат-бота дорогая флагманская модель редко даёт пропорциональный прирост качества. Китайские разработчики агрессивно продвигают открытые веса, и такой формат распространения снимает зависимость от публичного API — LLM разворачивается в дата-центре заказчика или в российском облаке.
Локальное развёртывание меняет саму архитектуру работы с ИИ. Модель может быть китайской, но документы, запросы сотрудников, исходный код и результаты обработки остаются внутри инфраструктуры компании. Именно поэтому связка «китайская LLM плюс российское облако» превращается для банков, промышленности, ритейла и госсектора в компромисс между современными возможностями и требованиями к контролю над данными.
Мировой рынок тоже перестраивается. Советник «Яков и Партнёры» Сергей Кобелев привёл расчёты по OpenRouter, согласно которым доля американских флагманских моделей за год сократилась примерно с 70% до 30%. Среди десяти наиболее используемых моделей около 75% объёма токенов приходится на китайские разработки. Оговорка здесь необходима — OpenRouter показывает открытый сегмент и не отражает закрытые корпоративные развёртывания крупнейших компаний, однако направление движения выглядит показательно.
Российский рынок LLM в целом ускоряется. MWS Cloud оценивает его рост в 2026 году примерно в 35%, до 19,6 млрд руб. Облачный сегмент с доступом через API или SaaS компания оценивает в 1,5 млрд руб., но в «Турбо Облаке» «Ростелекома» считают эту цифру заниженной и прогнозируют коммерческую ёмкость к концу года на уровне 10–12 млрд руб. и выше.
Границы рынка размываются, поскольку компания получает одну и ту же услугу тремя разными путями:
- через API зарубежного или отечественного провайдера;
- через готовый облачный сервис с доступом к нескольким моделям;
- через аренду GPU-мощностей и самостоятельное развёртывание открытой LLM.
Интересно, что конечный пользователь корпоративного сервиса чаще всего вообще не знает, какая именно модель обрабатывает его запрос, и для российского клиента банка или маркетплейса это создаёт дополнительную проблему — понять, где именно оседают его персональные данные, становится практически невозможно.
Открытая модель снимает необходимость постоянного обращения к зарубежному серверу — её можно разместить на российских GPU, настроить собственные ограничения, подключить корпоративные базы знаний и встроить в существующие информационные системы. Для сегментов с чувствительными данными это принципиальный момент, поскольку внутренняя документация и клиентские записи не должны свободно уходить внешнему поставщику.
Складывается прагматичная конструкция — российская компания использует китайскую модель, российское облако и собственные данные. Вопрос «чья модель лучше» уступил место другим — сколько стоит миллион токенов, где физически обрабатываются данные, можно ли развернуть модель самостоятельно и насколько легко встроить её в корпоративные процессы.
Китайские разработчики выигрывают по всем четырём пунктам одновременно, а ограничения на оплату зарубежных сервисов и требования к размещению данных в России делают их предложение особенно привлекательным.
Ранее сообщалось, что израильская компания Dream раскрыла кибератаку, где злоумышленники применили открытые ИИ-агенты OpenClaw и Hermes для почти полностью автоматизированного проникновения в государственные системы Тайваня. За четыре дня программная связка получила доступ минимум к 85 учетным записям, вывела более 2,5 тыс. записей о сотрудниках и обследовала десятки объектов инфраструктуры. Инцидент показал переход ИИ из роли инструмента в роль самостоятельного участника атаки.
Эксперты CISOCLUB отметили, что массовый переход российского бизнеса на китайские LLM формирует новый ландшафт зависимостей, который пока плохо изучен с точки зрения информационной безопасности. Открытые веса не гарантируют отсутствия скрытых закладок в обучающих данных, а прозрачность фильтров и цензурных ограничений китайских моделей остаётся низкой. Для рядового российского пользователя это означает, что общение с корпоративным чат-ботом банка, оператора связи или онлайн-сервиса может незаметно проходить через модель, обученную в другой юрисдикции с иными представлениями о приемлемом контенте.



