Суть релиза: Grok 4.5 для инженеров
SpaceXAI (xAI) выпустила модель Grok 4.5, позиционируя её как самый умный инструмент для инженерных задач, агентных сценариев и работы с знаниями. Ключевая особенность — модель обучалась в тесной связке с AI-редактором Cursor, что сделало её специализированным решением для разработки ПО. Модель доступна через API, в Grok Build и во всех тарифных планах Cursor.
Бенчмарки: где Grok 4.5 лидирует, а где уступает
SpaceXAI публикует результаты на четырех ключевых бенчмарках. Хотя модель Fable (max) показывает абсолютные лидерские результаты, Grok 4.5 демонстрирует конкурентоспособность, особенно на Terminal Bench. Важно отметить, что Grok 4.5 занял 1-е место в Harvey’s Legal Agent Benchmark, что подтверждает её силу в офисных и юридических задачах.
| Бенчмарк | Grok 4.5 | Лидер (Fable max) | Конкуренты (GPT 5.5 / Opus 4.8) |
|---|---|---|---|
| DeepSWE 1.0 (pass@1) | 62.0% | 66.1% | GPT 5.5: 64.31% Opus 4.8: 55.75% |
| DeepSWE 1.1 (resolve) | 53% | 70% | GPT 5.5: 67% Opus 4.8: 59% |
| Terminal Bench 2.1 | 83.3% | 84.3% | GPT 5.5: 83.4% Opus 4.8: 78.9% |
| SWE Bench Pro (resolve) | 64.7% | 80.4% | Opus 4.8: 69.2% GPT 5.5: 58.6% |
Главная фишка: эффективность токенов и цена
Основное преимущество Grok 4.5 — не абсолютная точность, а экономия ресурсов. На бенчмарке SWE Bench Pro модель использовала в среднем 15 954 выходных токена на задачу, тогда как Opus 4.8 (max) требовал 67 020 токенов. Это делает Grok 4.5 в 4.2 раза эффективнее по выходным данным, что напрямую снижает стоимость и задержку выполнения задач.
Тарификация также агрессивна: $2 за миллион входных токенов и $6 за миллион выходных. Скорость обслуживания составляет 80 TPS (токенов в секунду).
Технические детали и доступность
Обучение проходило на десятках тысяч GPU NVIDIA GB300 с использованием асинхронного обучения и усиленного обучения с подкреплением (RL) на сотнях тысяч задач. Модель интегрирована в Cursor по умолчанию в Grok Build. Доступна в США, в ЕС ожидается к середине июля 2026 года. ID модели для API: grok-4.5.
Бенчмарки
| Бенчмарк | Grok 4.5 | Fable (max) | GLM 5.2 | GPT 5.5 (xhigh) | Opus 4.8 (max) |
|---|---|---|---|---|---|
| DeepSWE 1.0 | 62% | 66.1% | — | 64.31% | 55.75% |
| DeepSWE 1.1 | 53% | 70% | — | 67% | 59% |
| Terminal Bench 2.1 | 83.3% | 84.3% | — | 83.4% | 78.9% |
| SWE Bench Pro | 64.7% | 80.4% | 62.1% | — | 69.2% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
