Релиз модели12 августа 2026 г., 19:45 МСК🤖 Auto

Grok 4.6 против GPT-5.6 Sol: ИИ xAI сравнялся с лидером бенчмарков

xAI выпустила Grok 4.6, которая достигла паритета с GPT-5.6 Sol по индексу Artificial Analysis. Модель делает ставку на долгосрочных агентов и сложную визуализацию.

Баннер новости 5629

Результаты бенчмарков: паритет с лидером

xAI официально представила Grok 4.6, позиционируя её как прорыв в области «агентного» программирования и работы с длинными контекстами. Ключевое достижение модели — равенство с GPT-5.6 Sol по综合ному Artificial Analysis Intelligence Index (61 балл против 61 балла). При этом в некоторых специфических тестах Grok 4.6 демонстрирует превосходство, особенно в задачах, требующих многошаговой логики.

Детальные метрики производительности

Сравнение Grok 4.6 с предшественником (Grok 4.5) и конкурентом (GPT-5.6 Sol) показывает значительный скачок в способности модели удерживать контекст и выполнять сложные инженерные задачи. Ниже приведена таблица ключевых показателей:

Бенчмарк Grok 4.6 Grok 4.5 GPT-5.6 Sol
AA Intelligence Index 61 56 61
GDPVal-AA v2 1753 1526 1728
CursorBench v3.2 69.9% 66.7% 70.5%
DeepSWE v1.1 65.9% 54% 73%
FrontierCode v1.1 (Extended) 61.3% 56.6% 63.6%
Terminal-Bench v3.0 26% 15.7% 34.6%
APEX-Agents 57.5% 47.1% 56.7%

Архитектура обучения: от SFT до RL

Модель обучалась на более длительном этапе дополняющего обучения (supplemental training) с использованием курированных данных, сгенерированных самой моделью, для улучшения рассуждений и технических концепций. Ключевым отличием стало использование Grok 4.5 для регенерации траекторий SFT (Supervised Fine-Tuning) с последующей фильтрацией проблемных сценариев. Финальный этап включал обучение с подкреплением (RL) на широком спектре агентных задач, включая оптимизацию ядра, веб-разработку и CAD.

Практическое применение: от идеи к продукту

xAI подчеркивает, что Grok 4.6 особенно сильна в превращении абстрактных идей в работающие прототипы. Модель способна самостоятельно исследовать незнакомые домены, структурировать приложение и реализовывать базовые взаимодействия за один проход. На длинных траекториях работы наблюдается рост самопроверки: модель начинает верифицировать свой код и логику перед переходом к следующему шагу, что критически важно для создания сложных систем.

Доступность и тарифы

Модель доступна через API xAI, а также интегрирована в Cursor и Grok Build. Стартовая цена составляет $2 за миллион входных токенов и $6 за миллион выходных. Существует также «быстрая» вариация модели по удвоенной цене. Для первых пользователей Grok Build и Cursor в течение первой недели после релиза предусмотрено удвоенный объем бесплатных запросов.

Бенчмарки

БенчмаркGrok 4.6Fable 5GPT-5.6 SolGrok 4.5
CursorBench v3.269.9%70.5%67.2%66.7%
DeepSWE v1.165.9%70%73%54%
FrontierCode v1.1 (Extended)61.3%63.6%60.6%56.6%
APEX-Agents57.5%59.2%56.7%47.1%
Terminal-Bench v3.026%34.1%34.6%15.7%
Harvey LAB (Vals)15.8%11.3%2.5%12.9%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: X ↗