Архитектура и ключевые изменения
SpaceXAI представила Grok 4.7, обновленный флагманский LLM, созданный с нуля, а не на базе Grok 4.6. Ключевые технические отличия включают:
- Новая базовая модель: Полностью переработанная архитектура, не использующая веса предыдущей версии.
- Углубленное обучение с подкреплением (RL): Увеличен объем RL-тренировки на сложных задачах, требующих много времени для решения.
- Улучшенная самопроверка: Модель стала точнее верифицировать собственные ответы, что критично для агентов.
- Поддержка Grok Bot: Нативная оптимизация под harness для диалоговых и知识-ориентированных задач.
Бенчмарки: где Grok 4.7 побеждает
Модель демонстрирует выдающиеся результаты в специализированных тестах, особенно в юридической сфере и веб-разработке. Ниже приведено сравнение с конкурентами (GPT-5.6 Sol Max, Fable 5.1 Max) и предыдущей версией.
| Бенчмарк | Grok 4.7 (xHigh) | Grok 4.6 (High) | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| EEBench | 64.0% (Лидер) | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent | 19.6% (Лидер) | 15.8% | 2.5% | 6.7% |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| HealthBench Prof. | 56.7% | 48.5% | 60.5% | 62.1% |
*DeepSWE v1.1 запущен в режиме High, остальные — xHigh. Fable 5.1 Max лидирует в 4 из 7 категорий, но стоит значительно дороже.
Безопасность и киберзащита
SpaceXAI внедрила новый стек защиты. На бенчмарке LatchBio (биобезопасность) Grok 4.7 показал 62.4%. На внутреннем тесте HackerBench v0.3 (кибербезопасность) модель пропустила всего 3.3% рискованных промптов, при этом редко блокируя легитимную работу специалистов по безопасности. Для партнеров доступен закрытый доступ к red-teaming.
Параметры API и цены
Ценообразование осталось неизменным по сравнению с Grok 4.6, что делает модель одной из самых выгодных на рынке:
- Цена: $2 за 1 млн входных токенов, $6 за 1 млн выходных.
- Контекст: 500,000 токенов.
- Модальности: Текст и изображение на вход, текст на выход.
- Режимы рассуждения: low, medium, high (по умолчанию), xhigh.
Доступна версия Grok 4.7 Fast (в 2 раза быстрее, но в 2 раза дороже) — доступна только в Cursor и Grok Build. Также есть региональный endpoint для США с наценкой 10% для хранения данных внутри страны.
Бенчмарки
| Бенчмарк | Grok 4.7 xHigh | Fable 5.1 Max | GPT-5.6 Sol Max | Grok 4.6 High |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 51.8% | 41.7% | 40.4% |
| DeepSWE v1.1 | 71% | 70% | 72.7% | 65.2% |
| EEBench | 64% | 56.4% | 39.4% | 53% |
| Terminal-Bench 4.0 | 38% | 57.9% | 37.3% | 20.3% |
| Harvey Legal Agent Benchmark | 19.6% | 6.7% | 2.5% | 15.8% |
| HealthBench Professional | 56.7% | 62.1% | 60.5% | 48.5% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
