Релиз модели16 июля 2026 г., 03:18 МСК🤖 Auto

AI-гонка: Grok 4.5 и GPT-5.6 меняют правила игры по цене и качеству

В июле 2026 года произошел резкий сдвиг в балансе сил: закрытые модели OpenAI и SpaceXAI по стоимости за единицу интеллекта сравнялись с или превзошли открытые решения, а GPT-5.6 стала доступна всем.

Баннер новости 3680

Исторический сдвиг: закрытые модели побеждают по цене

Ранее открытые модели (open weights) имели явное преимущество в стоимости за единицу полезного результата. Эта неделя всё изменила. Grok 4.5 от SpaceXAI и GPT-5.6 Luna от OpenAI демонстрируют более высокую эффективность затрат по сравнению с лидером открытого сегмента GLM-5.2.

Ключевой метрикой стала не цена за миллион токенов, а стоимость за успешное выполнение задачи. Grok 4.5 использует в 3 раза меньше выходных токенов на задачу (14 000 против 43 000 у GLM-5.2), что делает её экономически выгоднее, несмотря на более высокую базовую ставку.

Сравнительная таблица производительности и стоимости

Ниже приведены данные Artificial Analysis Intelligence Index и метрики стоимости за задачу (task cost) для ключевых моделей недели:

Модель Интеллект (Index Score) Стоимость за задачу (USD) Ключевые особенности
Grok 4.5 (SpaceXAI) 54 ~$0.31 Лучшее соотношение цена/качество, 80 токенов/сек, сильна в SWE Marathon
GPT-5.6 Luna (OpenAI) 51 ~$0.21 Самая дешевая, 200+ токенов/сек, лидер в Coding Agent Index (Codex)
Muse Spark 1.1 (Meta) 51 ~$0.26 Контекст 1M токенов, оптимизация для multi-agent систем
GLM-5.2 (Open Weights) 51 ~$0.37 Бывший лидер open-source, теперь проигрывает в цене
Sol (OpenAI) 59 Выше среднего Конкурент Claude Fable 5, силен в коде и структурированном выполнении

OpenAI: GPT-5.6 в общем доступе и взрывной рост пользователей

OpenAI вывела семейство GPT-5.6 (включая модели Sol, Terra, Luna) из закрытого превью в общий доступ. Параллельно запущен GPT-Realtime-2.1 с улучшенной обработкой прерываний и снижением p95 задержки на 25%.

Адаптация идет стремительно: после объединения Chat, Work и Codex в единое десктопное приложение, число активных пользователей достигло 8 миллионов. Более 1 миллиона пользователей Codex уже используют его вне сферы разработки ПО, что сигнализирует о выходе AI-агентов в массовый сегмент.

SpaceXAI Grok 4.5: Синергия с Cursor

Модель обучалась на триллионах токенов данных Cursor (с учетом Privacy Mode), что дало ей преимущество в агентном программировании. Grok 4.5 показывает 29% прохождения сложных профессиональных задач (SWE Marathon), опережая GPT-5.5 и Opus 4.8. Однако модель требует контроля: уровень галлюцинаций на тесте AA-Omniscience составляет 54%, а на Benchmark CursorBench выявлено загрязнение данных.

Meta Muse Spark 1.1: Прорыв в Multi-Agent

Meta представила модель, специально обученную для работы в связке «ведущий агент — подчиненный агент». Muse Spark 1.1 улучшила индекс Artificial Analysis на 8 пунктов за три месяца. Модель демонстрирует отличные результаты в использовании инструментов (MCP Atlas: 88.1), но пока уступает лидерам в сложных кросс-приложений задачах (DeepSWE: 53.3). Meta признает, что текущая автономность недостаточна для полностью автоматизированных исследований.

Источник: Towards AI newsletter ↗