ИИ в 2026 году уже упёрся в потолок вычислений — наиболее мощные модели становятся недоступными для большинства пользователей

ИИ в 2026 году уже упёрся в потолок вычислений — наиболее мощные модели становятся недоступными для большинства пользователей

изображение: grok

Американские разработчики искусственного интеллекта закручивают гайки вокруг доступа к самым ресурсоёмким моделям. Пользователи натыкаются на лимиты, очереди, разноуровневые подписки, верификацию личности и постепенное открытие функций. Публично компании объясняют это безопасностью и защитой от злоупотреблений, но за ширмой скрывается прозаичная причина — вычислительных мощностей физически не хватает, чтобы дать всем желающим столько ИИ, сколько они готовы потреблять.

Поведение самих разработчиков выдаёт масштаб проблемы. OpenAI прямо называет расширение вычислительной инфраструктуры условием удовлетворения спроса и продолжает ускорять ввод новых мощностей. Проект Stargate строится как долгосрочная основа для работы ИИ-сервисов, поскольку спрос со стороны бизнеса, разработчиков и государственных структур растёт быстрее, чем предполагали ещё год назад. Российских пользователей это касается напрямую — большинство мощных зарубежных сервисов уже давно доступны только через обходные пути, а введение новых лимитов делает даже платный доступ через посредников менее предсказуемым.

К 2026 году вычислительный ресурс превратился в отдельный товарный рынок. Nvidia вместе с крупнейшими финансовыми организациями США запустила механизмы финансирования ИИ-инфраструктуры более чем на 500 млрд $. Облачные компании ищут деньги на новые мощности, потому что существующих площадок мало.

Показательные признаки дефицита проявляются в нескольких направлениях:

  • очереди и waitlist-ы на новые модели даже у крупных вендоров;
  • автоматическое переключение с мощной модели на облегчённую после исчерпания лимита;
  • недельные квоты вместо привычных дневных;
  • обязательная верификация личности для доступа к тяжёлым функциям.

Отдельная показательная ситуация произошла с видеогенерацией Sora от OpenAI. Такие сервисы относятся к самым тяжёлым для инфраструктуры направлениям — генерация одного короткого ролика требует в разы больше вычислений, чем текстовый ответ, поэтому популярность видеомоделей быстро превращается в проблему пропускной способности.

Стоит обратить внимание, что индустрия смещает акцент с эффектных демонстраций на корпоративное применение — компании хотят, чтобы ИИ круглосуточно обрабатывал документы, запускал агентов и участвовал в рабочих процессах сотрудников.

Один пользователь, задающий вопросы чат-боту эпизодически, потребляет мало ресурсов. Компания с тысячами сотрудников, подключённых к модели, и десятками автоматизированных процессов — уже совсем другой клиент. Борьба идёт не только за число пользователей, но и за интенсивность.

В июле OpenAI серьёзно снизила стоимость некоторых моделей. Для бизнеса — отличная новость, за тот же бюджет можно обрабатывать больше документов и подключать больше сотрудников. Но скидка создаёт нагрузку — чем дешевле обращение к мощной модели, тем меньше причин экономить на запросах. Компания снижает цену, клиенты активнее пользуются, нагрузка растёт, приходится строить новые дата-центры, закупать ускорители, искать электричество.

За текстовым полем и кнопкой отправки скрывается совсем другой мир. Каждый запрос проходит через вычислительную инфраструктуру, и если модель отвечает коротко — нагрузка одна, а если анализирует большой документ, выполняет длинную цепочку рассуждений или работает в режиме автономного агента, счётчик потреблённых ресурсов раскручивается в десятки раз быстрее.

Современные тарифы всё меньше напоминают обычную подписку на программу. Бесплатный аккаунт получает ограниченный доступ, платный — больше запросов, дорогой тариф открывает мощные модели и тяжёлые функции, для корпоративных клиентов появляются отдельные уровни обслуживания. OpenAI прямо указывает, что API имеет ограничения на интенсивность, а рост потребления автоматически увеличивает доступные лимиты.

У Anthropic ситуация развивается по похожей траектории. В конце июля компания ввела недельные ограничения для Claude Pro и Max. Причина показательна — Claude Code получил огромный спрос, некоторые пользователи запускали его непрерывно в фоновом режиме. Anthropic сообщила, что новые ограничения затронут менее 5% подписчиков, приведя пример пользователя, расходовавшего на вычисления десятки тысяч долларов при подписке 200 $.

Ограничительная механика проявляется в нескольких формах:

  • автоматический перевод на облегчённую модель после исчерпания лимита;
  • система кредитов для продолжения работы за отдельную плату;
  • приоритетная очередь для корпоративных клиентов;
  • привязка лимитов к объёму контекста, а не только к числу запросов.

Показательный пример дала китайская Moonshot AI — после запуска Kimi K3 спрос оказался настолько высоким, что через несколько дней компания ограничила доступ для новых подписчиков. Для российских пользователей это тоже болезненный сигнал, ведь китайские альтернативы часто рассматриваются как обходной путь на случай проблем с западными сервисами, а теперь очереди появляются и там.

Уточняется, что верификация личности объясняется борьбой с мошенничеством, но её реальная функция шире — сервису проще управлять потреблением ресурсов, когда точно понятно, кто находится по другую сторону экрана.

Anthropic в феврале сообщила об обнаружении масштабных попыток дистилляции — по версии компании, DeepSeek, Moonshot и MiniMax использовали фиктивные аккаунты для отправки миллионов запросов к Claude и последующего использования ответов при разработке собственных моделей. Каждый такой запрос имеет двойную стоимость — Anthropic оплачивает вычисление, а результат помогает конкуренту.

Nvidia в августе объявила о сотрудничестве с шестью финансовыми организациями для привлечения более 500 млрд $ капитала под расширение ИИ-инфраструктуры, готовая обеспечить до 125 млрд $ собственных гарантий. IBM и Together AI заключили многолетнее соглашение стоимостью 240 млн $ на создание кластера для инференса — первая очередь включает около 2000 ускорителей Nvidia Blackwell, причём доступная мощность может быть полностью забронирована за несколько месяцев до ввода.

Даже покупка нужного количества ускорителей не гарантирует появления вычислений — нужны дата-центры, электричество, охлаждение, сетевое оборудование и физические площадки. Анализ инфраструктуры Microsoft, проведённый Guardian, показал, что у компании может быть существенно меньше реально развёрнутых ИИ-ускорителей, чем предполагают её инвестиции. Одной из причин называются задержки строительства дата-центров и ограничения по энергоснабжению. Microsoft оспорила выводы газеты.

Ранее сообщалось, что «Яндекс» предложил создать национальный набор заданий для проверки ИИ-моделей на соответствие духовно-нравственным ориентирам России. Концепция пока находится на ранней стадии, а вопросы касаются не столько содержания заданий, сколько будущей методики — кто составит вопросы, кому достанется доступ к результатам и станет ли весь набор открытым.

Эксперты CISOCLUB отметили, что нынешняя ситуация меняет правила игры для всех участников рынка. Вычислительная мощность становится самостоятельным конкурентным преимуществом, а не просто дополнением к качеству модели. Две компании могут иметь сопоставимые нейросети, но одна способна обслуживать вдвое больше запросов — для бизнеса это может оказаться значимее разницы в бенчмарках.

Для российской аудитории риск двойной — сначала санкционные ограничения на прямой доступ, а затем ещё и физический дефицит мощностей на стороне разработчика. Даже готовность платить премию не гарантирует стабильного получения самых мощных моделей, и рынок посреднических сервисов, через которые российские пользователи и компании получают доступ к ChatGPT или Claude, оказывается заложником этих квот. Гонка идёт за тот, кто одновременно создаст лучшую модель и построит достаточно большой компьютер, чтобы ею вообще можно было пользоваться.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: