Американский бизнес переключается на китайские ИИ ради экономии

Американские компании переводят часть ИИ-нагрузки с дорогих закрытых моделей на решения с открытыми весами, и заметная доля этих решений родом из Китая. По данным Vercel, в августе 2026 года модели open-weight впервые обработали больше половины токенов в её AI Gateway, а доля выросла до 56% с менее чем 7% в декабре 2025 года.
Согласно Financial Times, с августа по сентябрь 2026 года руководители американских компаний упоминали open-source и open-weight технологии в выступлениях примерно в 6 раз чаще, чем годом ранее, и интересуются уже не только айтишники, но и банки, логистика и тяжёлая промышленность. Открытые модели перемалывают 56% токенов Vercel, но забирают всего 14% расходов, ведь дорогие флагманы по-прежнему съедают львиную долю бюджета. Средняя цена токена в августе упала на 23,2%, и это 3-й месяц подряд с падением.
На OpenRouter китайские модели весь 2026 год сидят в верхних строчках рейтинга по объёму токенов. В июльской статистике все 5 первых мест заняли китайские разработки:
- модель Xiaomi;
- модель DeepSeek;
- модель MiniMax;
- модель Alibaba;
- модель Moonshot.
Стоит обратить внимание, что в июле китайские модели давали свыше 60% всего маршрутизируемого объёма при трафике более 20 трлн токенов в неделю.
На 27 сентября среди востребованных моделей числятся DeepSeek, Xiaomi, Tencent и Z.ai рядом с американскими системами. Рейтинг мерит только поток через API самого OpenRouter, поэтому за весь корпоративный рынок ИИ его выдавать нельзя.
Tinder начал переводить часть второстепенных запросов на open-weight модели, причина в счетах, по словам технического директора Виная Курувилы. Годовая стоимость этой нагрузки в январе составляла около 1 млн долларов, а к июлю выросла примерно в 10 раз. Когда сервис генерирует лавину запросов, разница в несколько центов на 1 млн токенов превращается в очень взрослый инвойс.
Американский бизнес не выкидывает OpenAI и Anthropic из инфраструктуры, а распределяет задачи по ценнику. Сложные запросы уходят в дорогую закрытую систему, а рутину получают модели подешевле:
- классификация документов;
- генерация типовых текстов;
- внутренний поиск;
- обработка больших массивов данных.
AT&T прогоняет около 45 млрд токенов в сутки через собственный AI Gateway, который выбирает модель под каждый запрос и умеет переключать её посреди многошагового диалога. Глава направления Data and AI Энди Маркус ранее рассказал, что оператор наращивает открытые модели ради экономии и специализации, ведь далеко не каждой задаче нужна модель верхнего ценового сегмента. В марте компания вступила в инициативу Open Telco AI и обучает открытые модели под телеком, где нейронка заранее знает оборудование и документацию отрасли.
Уточняется, что маршрутизация между моделями уже срезала расходы AT&T на ИИ до 90% и сэкономила компании миллионы долларов.
Открытые веса позволяют развернуть модель у себя и не отправлять каждый запрос внешнему вендору, что удобно для чувствительных данных. Бесплатным ИИ они при этом не становятся, потому что для самостоятельного запуска нужны:
- серверы и графические ускорители;
- хранилище;
- электричество;
- специалисты на обслуживание.
Железо для крупной модели легко съедает экономию, поэтому рынок идёт не к выбору между закрытым и открытым, а к связке вариантов с роутером-диспетчером на входе. OpenAI и Anthropic официально не обслуживают пользователей из России, поэтому для российских разработчиков open-weight остаётся способом добраться до современного ИИ без танцев с VPN и зарубежными картами. Слабое место в железе, ведь санкционные ограничения на поставки ускорителей Nvidia превращают локальный запуск крупных моделей в дорогое удовольствие.
Alibaba в сентябре представила ускоритель Zhenwu V900 и анонсировала следующую модель. Цифры по её заявлениям:
- ускоритель должен выдавать примерно в 3 раза больше производительности, чем предыдущее поколение;
- массовое производство стартует в начале 2027 года;
- следующая модель получит от 5 до 10 трлн параметров при 2,4 трлн у нынешней Qwen3.8-Max.
Китайские лаборатории собирают в связку модели, ускорители, облака и каналы дистрибуции, и чем больше сильных open-weight систем лежит в открытом доступе, тем труднее американским вендорам держать клиентов лишь ценником на закрытый доступ. Конкуренция идёт не только между США и Китаем, в open-weight играют Nvidia, французская Mistral и несколько американских стартапов, поэтому ярлык «китайский ИИ» не стоит читать буквально.
ИТ-директору всё равно, где сидит штаб-квартира лаборатории, если модель решает задачу, стоит дешевле и оставляет данные под контролем. Российскому бизнесу локальный запуск закрывает ещё и вопрос с персональными данными, ведь отправка клиентской информации в зарубежный API превращается в головную боль с 152-ФЗ. Корпоративный ИИ становится обычной серверной инфраструктурой, где дорогой интеллект оставляют для сложных задач, а рутину отдают дешёвым моделям.
Эксперты CISOCLUB отметили, что переезд на open-weight не убирает риски, а переносит их внутрь компании. Локальный запуск оставляет данные в периметре, но ответственность за обновления, изоляцию и мониторинг ложится на заказчика. Роутер вроде AI Gateway копит весь трафик к моделям и становится лакомой целью, поэтому токены доступа и правила маршрутизации надо защищать как платёжный шлюз.
Веса из случайных репозиториев в формате pickle способны исполнить вредоносный код при загрузке, а safetensors с проверкой источника закрывает часть проблемы. Дообученные сторонние модели без аудита могут нести закладки в поведении, поэтому их гоняют на подмену ответов и утечки до выхода в прод. Происхождение модели и лицензию стоит проверять до внедрения, а не после письма от юристов.
Ранее сообщалось, что OpenAI расширила семейство GPT-6 двумя более доступными моделями — Sol и Luna, которые вышли вслед за флагманской Astra. Стоимость их использования через API оказалась примерно вдвое ниже промо-тарифов моделей предыдущего поколения. Обе новинки используют часть технологий Astra, но рассчитаны прежде всего на массовые задачи, а не на сложную интеллектуальную работу. Для GPT-6 Sol цена составляет $2 за миллион входных токенов и $10 за миллион выходных, тогда как GPT-6 Luna стоит $0,10 и $0,50 соответственно. Разработчики объясняют снижение стоимости улучшенным кэшированием и оптимизацией внутренней механики инференса, отвечающей за обработку запросов через вычислительную инфраструктуру.



