Результаты в инженерных задачах: Grok 4.5 против топов рынка
xAI позиционирует Grok 4.5 как самую умную модель для кода, автономных агентов и работы с данными. Обучение проходило на десятках тысяч GPU NVIDIA GB300 с акцентом на фильтрацию данных и reinforcement learning. В ключевых бенчмарках модель демонстрирует высокие результаты, хотя и не всегда занимает первое место, оставаясь в топ-3.
| Бенчмарк | Fable (max) | GPT 5.5 (xhigh) | Grok 4.5 | Opus 4.8 (max) |
|---|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 66.1% | 64.31% | 62.0% | 55.75% |
| DeepSWE 1.1 | 70% | 67% | 53% | 59% |
| Terminal Bench 2.1 | 84.3% | 83.4% | 83.3% | 78.9% |
| SWE Bench Pro (resolve rate) | 80.4% | 58.6% | 64.7% | 69.2% |
Экономия ресурсов: в 4.2 раза меньше токенов
Главное преимущество Grok 4.5 — эффективность. Модель решает задачи в среднем за 15 954 выходных токенов, что в 4.2 раза меньше, чем у Opus 4.8 (67 020 токенов). При скорости обслуживания 80 TPS (токенов в секунду) это обеспечивает быстрый отклик и снижение затрат. Для сравнения, Grok 4.5 генерирует результаты быстрее и дешевле, чем многие «быстрые» модели конкурентов.
Интеграция в офисные задачи и IDE
Модель стала основой для плагина Grok Build. Помимо написания кода (включая сложные задачи на Rust и C++), Grok 4.5 умеет:
- Создавать сложные Excel-модели с формулами и ссылками на веб-данные.
- Генерировать презентации PowerPoint с использованием нативных фигур и диаграмм.
- Писать тексты в Word и оставлять заметки (stickies) для контекста.
Также модель доступна в IDE Cursor на всех тарифных планах.
Ценообразование и доступность
xAI предлагает агрессивное ценообразование: $2 за 1 млн входных токенов и $6 за 1 млн выходных токенов. Учитывая двойную эффективность по сравнению с лидерами рынка, это делает Grok 4.5 одним из самых выгодных решений для enterprise-задач.
Модель доступна через API SpaceXAI, в Grok Build и Cursor. В Европейском Союзе запуск ожидается в середине июля 2026 года. Для тестирования предоставляется бесплатный доступ в Grok Build.
Бенчмарки
| Бенчмарк | Grok 4.5 | Fable (max) | GPT 5.5 (xhigh) | Opus 4.7 (max) | Opus 4.8 (max) |
|---|---|---|---|---|---|
| DeepSWE 1.0 | 62% | 66.1% | 64.31% | — | 55.75% |
| DeepSWE 1.1 | 53% | 70% | 67% | — | 59% |
| Terminal Bench 2.1 | 83.3% | 84.3% | 83.4% | — | 78.9% |
| SWE Bench Pro | 64.7% | 80.4% | — | 64.3% | 69.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: X ↗
