SpaceXAI представила Grok 4.6 — новинку, которая, по заявлению компании, выходит на уровень самых мощных моделей на рынке при цене вдвое ниже конкурентов: $2 за миллион входных токенов и $6 за миллион выходных. Модель уже доступна в агенте Grok Build, в Cursor, в боте Grok Bot и через API, а в Cursor и Grok Build первую неделю действует двойной лимит использования.

Главная цифра релиза — 61 балл на Intelligence Index независимой аналитической платформы Artificial Analysis, сводном показателе из девяти бенчмарков. Это ровно столько же, сколько у GPT-5.6 Sol на максимальном режиме рассуждений, и на балл меньше, чем у Claude Fable 5 Max. И плюс целых 5 баллов к Grok 4.5 за месяц с небольшим. По формулировке аналитиков, SpaceXAI вернулась на фронтир интеллекта — впереди теперь только Anthropic.

Если разобрать таблицу из анонса, видно, где Grok 4.6 действительно впереди. На GDPVal-AA v2 — бенчмарке "офисной" работы со знаниями — у него 1753 балла против 1741 у Fable 5 и 1728 у Sol. На AA-Briefcase та же картина: 1577 против 1574 и 1502. А на юридическом Harvey LAB он первый с 15,8% — у Fable 5 здесь 11,3%, а GPT-5.6 Sol и вовсе проваливается с 2,5%. Закономерность простая: сильнейшая сторона модели — работа с документами, анализом и прикладными офисными задачами.

При этом Grok 4.6 заметно отстает на Terminal-Bench v3.0: 26% против 34,6% у Sol и 34,1% у Fable 5. Но у Artificial Analysis в индексе стоит предыдущая версия этого бенчмарка, v2.1 — и там у Grok 4.6 88,4%, второй результат после Claude Opus 5. Получается, с рутинной работой в терминале модель справляется наравне с лидерами, а проседает именно на новой, усложненной версии теста. Проигрывает она и на части кодинговых бенчей: на DeepSWE уступает и Sol (73%), и Fable 5 (70%), на FrontierCode и APEX-SWE — Fable 5.

Самое интересное в релизе — как достигнут паритет. По словам Маска, Grok 4.6 построен на той же базе в 1,5 триллиона параметров, что и Grok 4.5: модель не стала больше. Вместо масштабирования компания провела еще один, более долгий цикл обучения той же базы — с курированными синтетическими данными по рассуждениям и инженерным темам и улучшенным оптимизатором, — а затем перестроила этапы SFT и RL. SFT-траектории перегенерировали самим Grok 4.5, отфильтровав проблемные примеры модельными проверками: фактически предыдущая версия обучила следующую.

В Cursor, который теперь принадлежит SpaceXAI, отмечают, что Grok 4.6 с первого прохода выстраивает структуру и визуальный язык приложения по описанию идеи, а на длинных траекториях у модели стало заметно больше самопроверки: она тестирует собственную работу, прежде чем двигаться дальше. RL-задачи при обучении были самые разные — от оптимизации вычислительных ядер до веб-разработки и CAD.

Экономика при этом осталась от Grok 4.5, вышедшего 8 июля: те же $2/$6 — по подсчетам Artificial Analysis, это на 60% с лишним ниже прайса Claude Opus 5 ($5/$25) и GPT-5.6 Sol ($5/$30). Задача из Intelligence Index обходится модели в $0,84 — как у Kimi K3, но при чуть большем интеллекте, то есть ровно на Парето-фронте "ум против цены". Сохранилась и фирменная токен-эффективность: на бенчмарке AA-Briefcase Grok 4.6 закрывает длинную агентную задачу в среднем за 53 хода и полмиллиарда входных токенов — против 103 ходов и двух миллиардов у Claude Opus 5. Подорожали только кэш-хиты: с $0,3 до $0,5 за миллион.

SpaceXAI взяла отличный темп выпуска новых моделей. Grok 4.5 вышел 8 июля, Grok 4.6 — 12 августа, а Grok 4.7 на 2,1 триллиона параметров Маск на августовском звонке оценивал в три-четыре недели — то есть ждать ее стоит к концу лета. Добавьте сюда покупку Cursor и запущенного накануне агента Grok Bot — и видно, как Grok из вечного мема про "спроси у Грока" превращается в продуктовую линейку с собственной средой разработки, агентом и конвейером моделей.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.