ИИ-модели устаревают за считанные месяцы, а токены дешевеют ещё быстрее

ИИ-модели устаревают за считанные месяцы, а токены дешевеют ещё быстрее

изображение: grok

Vercel опубликовала сентябрьский AI Gateway Production Index, и большая часть токенов в нём приходится на модели, вышедшие менее 4 месяцев назад. Средняя цена токена упала на 23,2%, и это 3-й месяц снижения подряд. Модели с открытыми весами обработали 56% всего объёма при 14% расходов.

Компания выбирает нейросеть, прикручивает API, гоняет тесты, начинает жечь токены, а вендор уже выкатывает следующее поколение. Рядом конкурент предлагает модель подешевле, которую можно поднять на собственном железе и не спрашивать разрешения у владельца закрытой платформы. Модель превращается в легаси быстрее, чем финдиректор успевает утвердить бюджет на её внедрение.

За каждый запрос, разобранный документ, сгенерированный кусок кода и проанализированную таблицу компания платит поставщику живые деньги, поэтому токен давно стал строкой в бюджете. Vercel сообщила, что основная часть токенов в сентябре ушла на модели возрастом в несколько месяцев, а старые версии остаются в API, но превращаются в технику прошлого поколения. Кто заранее закупил пакеты доступа под конкретную модель, тот получил финансовый риск в подарок, ведь деньги потрачены, а рынок убежал.

Замена модели в проде, будь то поддержка клиентов, разбор документов или помощник для разработчиков, тянет за собой:

  • тесты на реальных данных;
  • контроль качества ответов;
  • проверку безопасности;
  • иногда переписывание всей логики взаимодействия с моделью.

Производители оптимизируют модели и инфраструктуру, поставщики грызутся за клиентов, а open-weight-системы позволяют запускать нейросети самостоятельно или на недорогих облачных мощностях. Когда архитектура приложения намертво привязана к конкретной закрытой модели, смена вендора превращается в мини-апокалипсис с массовым переписыванием кода. Система с быстрым переключением между моделями получает свободу манёвра и спокойный сон девопсов.

Сравнить 2 модели по качеству ответов теперь мало, поэтому в таблицу выбора добавляются вопросы:

  • сколько стоит 1 млн токенов;
  • сколько вычислений нужно для работы;
  • можно ли разместить систему на своих серверах;
  • насколько легко заменить её через несколько месяцев.

В апреле 2026 года на open-weight-модели приходилось всего 13% токенов в AI Gateway, а в декабре 2025 года около 10%. К сентябрю доля выросла до 56% при 14% расходов, то есть больше 50% трафика едет на системах с доступными весами и кушает крошечный кусок бюджета. Open-weight можно развернуть у себя или на недорогом облаке, а закрытая модель всегда приходит с прайсом поставщика.

Уточняется, что закрытые модели продолжают занимать значительную долю расходов, хотя в общем объёме токенов их доля заметно меньше.

Среди open-weight-моделей Vercel отдельно выделила Meta Llama* 4, но самым громким дебютом стала Jev от TypeSafe AI. Она работает с другим типом входных данных, чем привычные чат-модели, и берёт очень низкую цену за токен. Vercel назвала Jev самой быстро принятой новой моделью с запуска индекса, и она заметно повлияла на общий уровень цен. Даже игрок с небольшой долей рынка давит на стоимость, если разработчики бегут за дешёвым токеном.

Российским разработчикам эта арифметика знакома не понаслышке, потому что доступ к зарубежным API и облакам нередко упирается в блокировки и платёжные ограничения, а скачанные веса, запущенные у себя, от чужого рубильника не зависят.

Отказ от оплаты каждого токена поставщику превращает строку в счёте в другую математику, где живут:

  • серверы и GPU;
  • электроэнергия;
  • обслуживание и обновление моделей;
  • работа специалистов.

Интересно, что «бесплатные веса» не означают бесплатный ИИ, потому что расходы просто переезжают из счёта поставщика в серверную.

Небольшой компании дешевле готовый API, крупной с огромным потоком запросов выгоднее свой сервер, а остальным подойдёт гибрид. Модель, которая сидит в проде и выдаёт предсказуемый результат, вполне доживёт до пенсии, пока новая система не начнёт делать ту же работу в несколько раз дешевле, ведь тогда старая проигрывает уже по экономике.

Fable 5, которая на определённом этапе считалась самой мощной моделью Anthropic, уступила по объёму использования собственной Opus 5 и Astra от OpenAI, и Vercel привела это как показательный пример. Пользователю чат-бота перестановка незаметна, а предприятию сложнее, потому что нейросеть сидит в поддержке и пайплайнах, где каждая замена требует проверок.

Бизнес платит за результат, а не за название Opus, Astra, Llama или Jev, то есть за стоимость обработки 1 млн документов, скорость агента и число ошибок для правки человеком. Дешёвая обработка позволяет запускать задачи, которые раньше не окупались, поэтому цена токена может падать даже при росте общего потребления.

Считать расходы на ИИ только по цене токена уже не получается, в расчёт приходится брать:

  • скорость обновления технологий;
  • цену миграции;
  • возможность подбирать разные модели под разные задачи.

Эксперты CISOCLUB отметили, что быстрая смена моделей в проде упирается не только в деньги, но и в безопасность, потому что новая модель приходит со своим поведением, своими уязвимостями к промпт-инъекциям и своими условиями обработки данных. Замена вендора без повторной проверки утечек, логирования и прав доступа агентов превращает экономию на токенах в инцидент с куда более дорогим счётом. Веса из непроверенных источников, бэкдоры в чекпойнтах и дыры в стеке инференса добавляют отдельную головную боль, поэтому скачанную модель нужно проверять по правилам, действующим для любой сторонней зависимости.

Для российских компаний самостоятельный запуск открытых моделей на своих мощностях снижает риск утечки данных за рубеж и зависимость от чужих API, а заодно упрощает хранение персональных данных внутри страны. Пока рынок гоняет модели на скорость, командам безопасности стоит заранее держать чек-лист приёмки новой модели, чтобы апгрейд не растянулся на месяцы согласований.

Ранее сообщалось, что исследователи из университета Цинхуа разработали метод Cache-to-Cache (C2C), с помощью которого несколько больших языковых моделей могут обмениваться данными напрямую через внутренние состояния, не переводя информацию в текстовый формат. Исследование приняли на конференцию ICLR 2026, а исходный код метода авторы опубликовали в открытом доступе. По их заявлению, такой способ взаимодействия позволяет ускорить совместную работу моделей и повысить качество получаемых ответов.

* Meta Platforms — признана в России экстремистской и её деятельность запрещена.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных