Стоимость развёртывания ведущих мировых LLM в России за год выросла в 2,8 раза

Стоимость развёртывания ведущих мировых LLM в России за год выросла в 2,8 раза

Изображение: Taylor Vick (unsplash)

MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году — в 2,8 раза.

В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.

Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.

Год Наиболее популярный GPU Другие GPU
2025 H100 — для трёх из шести моделей H200 — для двух моделей; A100 — для одной
2026 H200 — для трёх из семи моделей B300 — для двух моделей; H100 и A100 — ещё для двух

Рейтинг моделей по стоимости запуска в 2025 году

Место Модель Количество параметров Минимальная конфигурация Стоимость
1 Kimi K2 1 трлн (32 млрд активных) 8 × H200 141 ГБ примерно 35 млн рублей
2 Qwen3 235 млрд (22 млрд активных) 4 × H200 141 ГБ примерно 18 млн рублей
3 GLM-4.5V 106 млрд (12 млрд активных) минимум 4 × H100 80 ГБ примерно 15 млн рублей
4 Gemma 3 27 млрд 2 × H100 80 ГБ примерно 7,5 млн рублей
5 gpt-oss 117 млрд (5,1 млрд активных) 1 × H100 80 ГБ более 3,5 млн рублей
6 Cotype Pro 2 32 млрд 1 × A100 80 ГБ примерно 3 млн рублей

Рейтинг моделей по стоимости запуска в 2026 году

Место Модель Количество параметров Минимальная конфигурация Стоимость
1 Kimi K3 2,8 трлн (104 млрд активных) 8 × B300 288 ГБ примерно 80 млн рублей
2 Qwen3.5 397 млрд (17 млрд активных) 8 × H200 141 ГБ примерно 55 млн рублей
2 DeepSeek-V4-Pro 1,6 трлн (49 млрд активных) 8 × H200 141 ГБ примерно 55 млн рублей
2 GLM-5.2 744 млрд (около 40 млрд активных) 8 × H200 141 ГБ примерно 55 млн рублей
5 DeepSeek-V4-Flash 284 млрд (13 млрд активных) 1 × B300 288 ГБ примерно 10 млн рублей
6 Gemma 4 31 млрд 2 × H100 80 ГБ примерно 7,5 млн рублей
7 Cotype Pro 3 27 млрд 1 × A100 80 ГБ примерно 3 млн рублей

Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.

Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.

Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.

«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», — отметил генеральный директор MWS Павел Воронин

MWS
Автор: MWS
МТС Web Services (MWS) — сервисы и продукты Enterprise-уровня для ИИ-экспериментов и цифровой трансформации бизнеса. Мы предлагаем передовые технологии, глубокую экспертизу, комплексную поддержку и надежную инфраструктуру, чтобы вы достигали новых высот.
Комментарии: