Стоимость развёртывания ведущих мировых LLM в России за год выросла в 2,8 раза

Изображение: Taylor Vick (unsplash)
MWS Cloud (входит в МТС Web Services) проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году — в 2,8 раза.
В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года — Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.
| Год | Наиболее популярный GPU | Другие GPU |
| 2025 | H100 — для трёх из шести моделей | H200 — для двух моделей; A100 — для одной |
| 2026 | H200 — для трёх из семи моделей | B300 — для двух моделей; H100 и A100 — ещё для двух |
Рейтинг моделей по стоимости запуска в 2025 году
| Место | Модель | Количество параметров | Минимальная конфигурация | Стоимость |
| 1 | Kimi K2 | 1 трлн (32 млрд активных) | 8 × H200 141 ГБ | примерно 35 млн рублей |
| 2 | Qwen3 | 235 млрд (22 млрд активных) | 4 × H200 141 ГБ | примерно 18 млн рублей |
| 3 | GLM-4.5V | 106 млрд (12 млрд активных) | минимум 4 × H100 80 ГБ | примерно 15 млн рублей |
| 4 | Gemma 3 | 27 млрд | 2 × H100 80 ГБ | примерно 7,5 млн рублей |
| 5 | gpt-oss | 117 млрд (5,1 млрд активных) | 1 × H100 80 ГБ | более 3,5 млн рублей |
| 6 | Cotype Pro 2 | 32 млрд | 1 × A100 80 ГБ | примерно 3 млн рублей |
Рейтинг моделей по стоимости запуска в 2026 году
| Место | Модель | Количество параметров | Минимальная конфигурация | Стоимость |
| 1 | Kimi K3 | 2,8 трлн (104 млрд активных) | 8 × B300 288 ГБ | примерно 80 млн рублей |
| 2 | Qwen3.5 | 397 млрд (17 млрд активных) | 8 × H200 141 ГБ | примерно 55 млн рублей |
| 2 | DeepSeek-V4-Pro | 1,6 трлн (49 млрд активных) | 8 × H200 141 ГБ | примерно 55 млн рублей |
| 2 | GLM-5.2 | 744 млрд (около 40 млрд активных) | 8 × H200 141 ГБ | примерно 55 млн рублей |
| 5 | DeepSeek-V4-Flash | 284 млрд (13 млрд активных) | 1 × B300 288 ГБ | примерно 10 млн рублей |
| 6 | Gemma 4 | 31 млрд | 2 × H100 80 ГБ | примерно 7,5 млн рублей |
| 7 | Cotype Pro 3 | 27 млрд | 1 × A100 80 ГБ | примерно 3 млн рублей |
Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.
Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.
Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.
«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», — отметил генеральный директор MWS Павел Воронин



