Grok 4.6 догнал GPT-5.6 и оказался дешевле конкурентов в разы

изображение: grok
SpaceXAI представила Grok 4.6 — новую флагманскую модель, которая по опубликованным данным добралась до верхнего эшелона ИИ при заметно меньшей стоимости использования. Тариф составил два доллара за миллион входных токенов и шесть долларов за миллион выходных, а в Intelligence Index модель набрала 61 балл, сравнявшись с GPT-5.6 Sol в максимальном режиме рассуждений.
Новая версия появилась в Grok Build, Cursor, Grok Bot и API. Для пользователей Cursor и Grok Build компания на первую неделю открыла удвоенный лимит обращений. Старт получился бодрый — модель не просто показали на презентации, а сразу отправили в несколько рабочих продуктов, где ей предстоит заниматься кодом, документами и агентными задачами.
Основная цифра релиза — 61 балл в Intelligence Index от Artificial Analysis. Показатель объединяет результаты девяти разных тестов и позволяет сравнивать модели не по одному красивому рекорду, а по целому набору задач. Grok 4.6 получил столько же, сколько GPT-5.6 Sol на максимальной ступени рассуждений, тогда как Claude Fable 5 Max оказался впереди на один балл. Прогресс относительно Grok 4.5, набравшего на пять баллов меньше, произошёл чуть больше чем за месяц.
Разложим результаты по отдельным испытаниям:
- в GDPVal-AA v2 Grok 4.6 набрал 1753 балла против 1741 у Fable 5 и 1728 у Sol;
- на AA-Briefcase модель получила 1577, Fable 5 — 1574, Sol — 1502;
- в Harvey LAB для юридических задач Grok 4.6 показал 15,8%, Fable 5 — 11,3%, Sol — 2,5%;
- на старом Terminal-Bench v2.1 модель Маска взяла 88,4% и уступила лишь Claude Opus 5.
Стоит обратить внимание — профиль новой версии становится вполне узнаваемым. Она убедительно смотрится в документах, анализе и профессиональной офисной работе, но с более сложным программированием справляется хуже соперников.
Слабые места тоже есть — на свежем Terminal-Bench v3.0 модель получила 26% при 34,6% у Sol и 34,1% у Fable 5. В DeepSWE Grok 4.6 уступил Sol с 73% и Fable 5 с 70%. На FrontierCode и APEX-SWE впереди снова оказался Fable 5. Разница между версиями терминального теста показательна — на привычных операциях командной строки модель выглядит конкурентоспособно, но после повышения сложности задания преимущество испаряется. Называть Grok безусловным королём программирования преждевременно.
Самая занятная часть связана с архитектурой. По словам Илона Маска, Grok 4.6 использует ту же основу примерно на 1,5 триллиона параметров, что и Grok 4.5. Компания не пошла по очевидному пути и не стала просто увеличивать размер нейросети. Вместо этого SpaceXAI устроила для прежней базы более продолжительный этап обучения, добавила в процесс отобранные синтетические данные по рассуждениям и инженерным дисциплинам, улучшила оптимизатор и переработала последовательность SFT и RL.
Схема подготовки данных выглядит любопытно:
- траектории для SFT заново генерировались при помощи Grok 4.5;
- проблемные варианты отбраковывались модельными проверками;
- предыдущая версия нейросети стала своеобразным наставником для следующей;
- обучающие задачи охватывали оптимизацию вычислительных ядер, веб-разработку и CAD.
В Cursor обратили внимание на изменения в поведении. По их наблюдениям, Grok 4.6 с первой попытки способен выстроить структуру приложения и его визуальный стиль, если получить достаточно подробное описание идеи. На длинных цепочках действий стало больше самопроверок — модель тестирует результат и вносит правки до перехода к следующему этапу. Для российских пользователей это означает появление ещё одного мощного и относительно доступного инструмента, к которому неизбежно потянутся разработчики и корпоративные заказчики.
Интересно, что экономия достигается не только тарифом, но и токенами. В AA-Briefcase Grok 4.6 выполняет длинную агентную задачу в среднем за 53 хода и использует около 500 млн входных токенов, тогда как Claude Opus 5 требуется примерно 103 хода и около двух миллиардов токенов.
Ценовая часть релиза выглядит агрессивно. Grok 4.6 сохранил тариф Grok 4.5, появившегося восемь июля. Миллион входных токенов стоит два доллара, миллион выходных — шесть. По расчётам Artificial Analysis, это более чем на 60% дешевле Claude Opus 5 с пятью долларами за миллион входных и 25 за миллион выходных.
Тариф GPT-5.6 Sol с пятью долларами за миллион входных и 30 за миллион выходных тоже смотрится дороже. Одна задача из Intelligence Index для Grok 4.6 оценивается примерно в 0,84 доллара, что сопоставимо с Kimi K3 при чуть более высоком уровне интеллекта.
Кэшированные обращения подорожали — с 0,3 до 0,5 доллара за миллион. Темп выпуска у SpaceXAI выглядит агрессивно:
- Grok 4.5 появился восемь июля;
- Grok 4.6 — 12 августа;
- Grok 4.7 с моделью примерно на 2,1 триллиона параметров Маск обещал через три-четыре недели.
Для отечественной аудитории риск двоякий — низкая цена ускорит проникновение модели в корпоративный контур, а вместе с ним подтянутся и вопросы утечки чувствительных данных через сторонний API, находящийся вне российской юрисдикции.
Ранее сообщалось, что GPT-5.6-Cyber от OpenAI получил закрытый режим доступа Daybreak Red и достался только проверенным организациям — среди них Accenture, IBM, Capgemini, Cognizant, EY, KPMG, PwC, NCC Group, SpecterOps, Palo Alto Networks, CrowdStrike, Cisco, Sophos, Akamai, Fortinet и Cloudflare. Новая модель умеет искать уязвимости, проверять их эксплуатируемость и помогать с исправлениями, но массовой раздачи не будет. Компания решила не выпускать самого сильного цифрового кибернетика в свободное плавание после инцидента с Hugging Face, когда во внутреннем тесте один из ИИ-агентов сумел скомпрометировать реальную инфраструктуру.
Эксперты CISOCLUB отметили, что удешевление флагманских моделей меняет расклад на рынке быстрее, чем успевают реагировать регуляторы. Ставка SpaceXAI на длительное дообучение прежней базы вместо наращивания параметров показала — качественная тренировка порой даёт больше, чем гонка размеров. Grok перестаёт быть забавным чат-ботом с репутацией модели, у которой спрашивают что угодно. Вокруг него формируется полноценная экосистема с собственными нейросетями, агентом, средой разработки и API. Основная интрига теперь не в способности догонять лидеров по отдельным тестам, а в том, удержит ли компания темп улучшений и низкую стоимость.



