Grok 4.6 сравнялась с GPT-5.6 Sol в рейтинге Artificial Analysis

SpaceXAI представила Grok 4.6 — новую AI-модель, рассчитанную в том числе на сложные и длительные задачи. В тестах Artificial Analysis она вплотную приблизилась к лидерам рынка: в общем Intelligence Index модель набрала 61 балл и сравнялась с GPT-5.6 Sol, уступив только Claude Opus 5 и Claude Fable 5.
При обучении Grok 4.6 разработчики сделали акцент на рассуждениях, сложных технических задачах, программировании и инженерных данных. Модель также обучали для агентных сценариев — то есть задач, где AI должен не просто ответить на вопрос, а самостоятельно выполнять последовательность действий и работать над задачей продолжительное время.
В тесте GDPval-AA v2 Grok 4.6 получила рейтинг Elo 1753 и уступила только Claude Opus 5. В закрытом тесте AA-Briefcase, который проверяет длительную самостоятельную работу AI с информационными задачами, результат составил 1577 Elo — здесь впереди также осталась Claude Opus 5.
SpaceXAI отдельно заявляет, что Grok 4.6 стала лучше Grok 4.5 справляться с созданием визуальных и интерактивных приложений с первой попытки. Это пока именно оценка разработчика, а не результат независимого тестирования.
По измерениям Artificial Analysis, Grok 4.6 генерирует около 67,6 токена в секунду. Стандартная версия стоит $2 за миллион входных токенов и $6 за миллион выходных. Ускоренный вариант предлагается по удвоенной цене — $4 и $12 соответственно.
Модель уже доступна пользователям Cursor и Grok Build, а разработчики могут подключать её через API. В течение первой недели SpaceXAI также предлагает удвоенный включённый объём использования Grok 4.6 в Cursor и Grok Build.
Предыдущая версия, Grok 4.5, вышла в июле. Она обучалась совместно с Cursor с использованием десятков тысяч ускорителей NVIDIA GB300. В Grok 4.6 компания сделала ещё больший упор на задачи, где модель должна работать дольше обычного чат-диалога и выполнять более сложные цепочки действий.
Это не означает, что Grok 4.6 безоговорочно сильнее GPT-5.6 Sol. В общем Intelligence Index обе модели набрали по 61 баллу, однако в отдельных тестах преимущество действительно переходило к Grok 4.6. Например, она оказалась выше в GDPVal-AA v2, CursorBench, APEX-Agents и AA-Briefcase, тогда как GPT-5.6 Sol сохранила преимущество в DeepSWE и Terminal-Bench. Результат поэтому скорее говорит о сопоставимом общем уровне моделей, чем об однозначной победе одной из них.
Источники: SpaceXAI, Artificial Analysis