SpaceXAI выпустила Grok 4.6 — новую версию своей языковой модели, которая, по заявлению компании, выходит на уровень самых мощных моделей рынка при цене вдвое ниже конкурентов. Релиз состоялся 12 августа, модель уже доступна в агенте Grok Build, в Cursor, в боте Grok Bot и через API. В Cursor и Grok Build первую неделю действует двойной лимит использования.

Главная цифра релиза — 61 балл на Intelligence Index независимой аналитической платформы Artificial Analysis, сводном показателе из девяти бенчмарков. Это ровно столько же, сколько у GPT-5.6 Sol на максимальном режиме рассуждений, и на балл меньше, чем у Claude Fable 5 Max. По сравнению с Grok 4.5, вышедшей 8 июля, прирост составил 5 баллов. По формулировке аналитиков, SpaceXAI вернулась на фронтир интеллекта — впереди теперь только Anthropic.

МодельIntelligence IndexЦена за 1M входных/выходных токенов
Grok 4.661$2/$6
GPT-5.6 Sol61$5/$30
Claude Fable 5 Max62$5/$25

Если разобрать таблицу из анонса, видно, где Grok 4.6 впереди. На GDPVal-AA v2 — бенчмарке «офисной» работы со знаниями — у нее 1753 балла против 1741 у Fable 5 и 1728 у Sol. На AA-Briefcase та же картина: 1577 против 1574 и 1502. А на юридическом Harvey LAB она первая с 15,8% — у Fable 5 здесь 11,3%, а GPT-5.6 Sol и вовсе проваливается с 2,5%. Закономерность простая: сильнейшая сторона модели — работа с документами, анализом и прикладными офисными задачами.

Цена за миллион входных токенов — $2, выходных — $6, что вдвое ниже конкурентов и на 60% дешевле Claude Opus 5.

При этом Grok 4.6 заметно отстает на Terminal-Bench v3.0: 26% против 34,6% у Sol и 34,1% у Fable 5. Но у Artificial Analysis в индексе стоит предыдущая версия этого бенчмарка, v2.1 — и там у Grok 4.6 88,4%, второй результат после Claude Opus 5. Получается, с рутинной работой в терминале модель справляется наравне с лидерами, а проседает именно на новой, усложненной версии теста. Проигрывает она и на части кодинговых бенчей: на DeepSWE уступает и Sol (73%), и Fable 5 (70%), на FrontierCode и APEX-SWE — Fable 5.

Самое интересное в релизе — как достигнут паритет. По словам Маска, Grok 4.6 построена на той же базе в 1,5 триллиона параметров, что и Grok 4.5: модель не стала больше. Вместо масштабирования компания провела еще один, более долгий цикл обучения той же базы — с курированными синтетическими данными по рассуждениям и инженерным темам и улучшенным оптимизатором, — а затем перестроила этапы SFT и RL. SFT-траектории перегенерировали самим Grok 4.5, отфильтровав проблемные примеры модельными проверками: фактически предыдущая версия обучила следующую.

В Cursor, который теперь принадлежит SpaceXAI, отмечают, что Grok 4.6 с первого прохода выстраивает структуру и визуальный язык приложения по описанию идеи, а на длинных траекториях у модели стало заметно больше самопроверки: она тестирует собственную работу, прежде чем двигаться дальше. RL-задачи при обучении были самые разные — от оптимизации вычислительных ядер до веб-разработки и CAD.

Экономика при этом осталась от Grok 4.5: те же $2/$6 — по подсчетам Artificial Analysis, это на 60% с лишним ниже прайса Claude Opus 5 ($5/$25) и GPT-5.6 Sol ($5/$30). Задача из Intelligence Index обходится модели в $0,84 — как у Kimi K3, но при чуть большем интеллекте, то есть ровно на Парето-фронте «ум против цены». Сохранилась и фирменная токен-эффективность: на бенчмарке AA-Briefcase Grok 4.6 закрывает длинную агентную задачу в среднем за 53 хода и полмиллиарда входных токенов — против 103 ходов и двух миллиардов у Claude Opus 5. Подорожали только кэш-хиты: с $0,3 до $0,5 за миллион.

SpaceXAI взяла отличный темп выпуска новых моделей. Grok 4.5 вышел 8 июля, Grok 4.6 — 12 августа, а Grok 4.7 на 2,1 триллиона параметров Маск на августовском звонке оценивал в три-четыре недели — то есть ждать ее стоит к концу лета. Добавьте сюда покупку Cursor и запущенного накануне агента Grok Bot — и видно, как Grok из вечного мема про «спроси у Грока» превращается в продуктовую линейку с собственной средой разработки, агентом и конвейером моделей.