Результаты бенчмарков: паритет с лидером
xAI официально представила Grok 4.6, позиционируя её как прорыв в области «агентного» программирования и работы с длинными контекстами. Ключевое достижение модели — равенство с GPT-5.6 Sol по综合ному Artificial Analysis Intelligence Index (61 балл против 61 балла). При этом в некоторых специфических тестах Grok 4.6 демонстрирует превосходство, особенно в задачах, требующих многошаговой логики.
Детальные метрики производительности
Сравнение Grok 4.6 с предшественником (Grok 4.5) и конкурентом (GPT-5.6 Sol) показывает значительный скачок в способности модели удерживать контекст и выполнять сложные инженерные задачи. Ниже приведена таблица ключевых показателей:
| Бенчмарк | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol |
|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 |
| CursorBench v3.2 | 69.9% | 66.7% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 63.6% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% |
Архитектура обучения: от SFT до RL
Модель обучалась на более длительном этапе дополняющего обучения (supplemental training) с использованием курированных данных, сгенерированных самой моделью, для улучшения рассуждений и технических концепций. Ключевым отличием стало использование Grok 4.5 для регенерации траекторий SFT (Supervised Fine-Tuning) с последующей фильтрацией проблемных сценариев. Финальный этап включал обучение с подкреплением (RL) на широком спектре агентных задач, включая оптимизацию ядра, веб-разработку и CAD.
Практическое применение: от идеи к продукту
xAI подчеркивает, что Grok 4.6 особенно сильна в превращении абстрактных идей в работающие прототипы. Модель способна самостоятельно исследовать незнакомые домены, структурировать приложение и реализовывать базовые взаимодействия за один проход. На длинных траекториях работы наблюдается рост самопроверки: модель начинает верифицировать свой код и логику перед переходом к следующему шагу, что критически важно для создания сложных систем.
Доступность и тарифы
Модель доступна через API xAI, а также интегрирована в Cursor и Grok Build. Стартовая цена составляет $2 за миллион входных токенов и $6 за миллион выходных. Существует также «быстрая» вариация модели по удвоенной цене. Для первых пользователей Grok Build и Cursor в течение первой недели после релиза предусмотрено удвоенный объем бесплатных запросов.
Бенчмарки
| Бенчмарк | Grok 4.6 | Fable 5 | GPT-5.6 Sol | Grok 4.5 |
|---|---|---|---|---|
| CursorBench v3.2 | 69.9% | 70.5% | 67.2% | 66.7% |
| DeepSWE v1.1 | 65.9% | 70% | 73% | 54% |
| FrontierCode v1.1 (Extended) | 61.3% | 63.6% | 60.6% | 56.6% |
| APEX-Agents | 57.5% | 59.2% | 56.7% | 47.1% |
| Terminal-Bench v3.0 | 26% | 34.1% | 34.6% | 15.7% |
| Harvey LAB (Vals) | 15.8% | 11.3% | 2.5% | 12.9% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: X ↗
