xAI представила Grok 4.6 — новую версию своей языковой модели, ориентированную на длительные агентные сценарии и сложные интерактивные задачи. Модель уже доступна в Cursor и Grok Build, а также через API и на платформах партнёров, включая OpenRouter, Vercel и Cloudflare. В первую неделю после релиза компания удваивает включённый объём использования Grok 4.6 в Grok Build и Cursor, чтобы пользователи могли сразу протестировать новинку.
Grok 4.6 развивает возможности предыдущей версии, делая акцент на задачах, требующих множества последовательных шагов: от исследования темы и анализа информации до работы с большой кодовой базой и превращения идеи в готовое приложение. По словам разработчиков, модель особенно сильна в превращении общей продуктовой идеи в первую рабочую версию: она может самостоятельно изучить незнакомую предметную область, продумать структуру приложения, реализовать ключевые сценарии взаимодействия и затем улучшать результат в несколько итераций с учётом обратной связи. На длинных последовательностях работы модель чаще демонстрирует элементы самопроверки и верификации.
| Benchmark | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
Обучение Grok 4.6 прошло в несколько этапов. Сначала модель прошла более длительный этап дополнительного обучения, чем Grok 4.5, с использованием тщательно отобранных данных, сгенерированных моделями, включая данные для развития рассуждений и понимания сложных технических концепций, а также высококачественные инженерные данные. Затем с помощью Grok 4.5 были заново сгенерированы SFT-траектории для различных уровней сложности рассуждений, агентных окружений и таких областей, как STEM, разработка ПО и интеллектуальная работа. Наконец, модель обучалась с помощью reinforcement learning на широком наборе агентных задач: от интеллектуальной работы и программирования общего назначения до специализированных сред, связанных с оптимизацией ядер, веб-разработкой и системами автоматизированного проектирования (CAD).
По результатам бенчмарков Grok 4.6 демонстрирует смешанные результаты. В сводном индексе Artificial Analysis Intelligence Index, объединяющем девять бенчмарков, модель набирает 61 балл, что сравнимо с GPT-5.6 Sol (62 балла) и выше, чем у Grok 4.5 (61 балл). Однако в отдельных тестах, таких как DeepSWE v1.1, Grok 4.6 показывает 65.9%, что значительно ниже, чем у
Безопасность модели также была улучшена. Разработчики отмечают, что механизмы защиты Grok 4.6 откалиброваны с учётом возросших возможностей, а система безопасности спроектирована так, чтобы сочетать полезность и защищённость в легитимных сценариях использования. Перед выпуском модель прошла самый широкий набор тестов за историю компании, включая проверки со стороны независимых третьих сторон. Это важно, поскольку Grok 4.6 может применяться для устранения уязвимостей, ускорения инженерного проектирования и поддержки исследований в области ИИ.
Grok 4.6 доступна в Cursor и Grok Build, а также через API и на платформах партнёров, включая OpenRouter, Vercel и Cloudflare. Стоимость использования модели не раскрывается, но удвоение включённого объёма в первую неделю может привлечь новых пользователей. В условиях растущей конкуренции на рынке агентных моделей, где свои решения предлагают OpenAI, Anthropic и другие, xAI делает ставку на интеграцию с популярными инструментами разработки и улучшенные возможности для длительных задач.

