Новая архитектура и фокус на долгих задачах
SpaceXAI выпустила Grok 4.7, позиционируя её как самую мощную модель для программирования и интеллектуального труда. В основе лежит новый, более крупный базовый модель, дообученная с помощью расширенного процесса обучения с подкреплением (RL). Ключевое отличие — смещение веса на сложные задачи, требующие многочасовой работы. Модель научилась лучше проверять собственные результаты и управлять длинным контекстом, а также нативно понимает интерфейс Grok Bot для улучшения диалоговых сценариев.
Лидерство в инженерных бенчмарках
В сравнении с ключевыми игроками рынка (GPT-5.6 Sol, Fable 5.1, Opus 5) Grok 4.7 демонстрирует выдающиеся результаты в задачах, требующих длительных вычислений. Особенно заметен разрыв в бенчмарке CursorBench 4.0, где модель показала 55 баллов, что является передовым показателем по соотношению цена/качество. Ниже приведено детальное сравнение производительности в различных профессиональных сферах.
| Бенчмарк / Задача | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 (Код) | 55.0 | — | — | — |
| DeepSWE v1.1 (SW Eng) | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench (Электротехника) | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 (Офис) | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal (Юриспруденция) | 19.6% | 15.8% | 2.5% | 6.7% |
* Отмечено как результат с высоким уровнем усилий (high effort).
Кибербезопасность и новые стандарты защиты
Особое внимание уделено безопасности. Grok 4.7 использует полностью новый стек защитных механизмов. В бенчмарке LatchBio по биобезопасности модель набрала 62.4%, лидируя в классе. В сфере кибербезопасности (HackerBench v0.3) Grok 4.7 демонстрирует баланс: она блокирует 96.7% вредоносных запросов (двойное назначение), пропуская лишь 3.3% рискованных промптов, но при этом минимизирует ложные срабатывания на легитимные задачи пентестеров. Для избранных партнеров уже открыт доступ к функциям red-teaming.
Ценообразование и доступность
Несмотря на рост производительности, цены остались на уровне предыдущей версии Grok 4.6, что делает модель крайне конкурентоспособной. Доступно два тарифа:
- Стандартный: $2 за 1 млн входных токенов, $6 за 1 млн выходных токенов.
- Fast (xHigh): Вдвое выше скорость вывода, цена умножается на 2.
Модель доступна через API, в IDE Cursor, платформе Grok Build, а также через сторонние роутеры и облачные платформы. Запуск API осуществляется стандартным способом через curl-скрипт.
Бенчмарки
| Бенчмарк | Grok 4.7 | Fable 5.1 | GPT-5.6 Sol | Grok 4.6 |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% | 41.7% | 40.4% |
| DeepSWE v1.1 | 71% | 70% | 72.7% | 65.2% |
| EEBench | 64% | 56.4% | 39.4% | 53% |
| Terminal-Bench 4.0 | 38% | 57.9% | 37.3% | 20.3% |
| Harvey Legal Agent Benchmark | 19.6% | 6.7% | 2.5% | 15.8% |
| HealthBench Professional | 56.7% | 62.1% | 60.5% | 48.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: X ↗
