Исторический сдвиг: закрытые модели побеждают по цене
Ранее открытые модели (open weights) имели явное преимущество в стоимости за единицу полезного результата. Эта неделя всё изменила. Grok 4.5 от SpaceXAI и GPT-5.6 Luna от OpenAI демонстрируют более высокую эффективность затрат по сравнению с лидером открытого сегмента GLM-5.2.
Ключевой метрикой стала не цена за миллион токенов, а стоимость за успешное выполнение задачи. Grok 4.5 использует в 3 раза меньше выходных токенов на задачу (14 000 против 43 000 у GLM-5.2), что делает её экономически выгоднее, несмотря на более высокую базовую ставку.
Сравнительная таблица производительности и стоимости
Ниже приведены данные Artificial Analysis Intelligence Index и метрики стоимости за задачу (task cost) для ключевых моделей недели:
| Модель | Интеллект (Index Score) | Стоимость за задачу (USD) | Ключевые особенности |
|---|---|---|---|
| Grok 4.5 (SpaceXAI) | 54 | ~$0.31 | Лучшее соотношение цена/качество, 80 токенов/сек, сильна в SWE Marathon |
| GPT-5.6 Luna (OpenAI) | 51 | ~$0.21 | Самая дешевая, 200+ токенов/сек, лидер в Coding Agent Index (Codex) |
| Muse Spark 1.1 (Meta) | 51 | ~$0.26 | Контекст 1M токенов, оптимизация для multi-agent систем |
| GLM-5.2 (Open Weights) | 51 | ~$0.37 | Бывший лидер open-source, теперь проигрывает в цене |
| Sol (OpenAI) | 59 | Выше среднего | Конкурент Claude Fable 5, силен в коде и структурированном выполнении |
OpenAI: GPT-5.6 в общем доступе и взрывной рост пользователей
OpenAI вывела семейство GPT-5.6 (включая модели Sol, Terra, Luna) из закрытого превью в общий доступ. Параллельно запущен GPT-Realtime-2.1 с улучшенной обработкой прерываний и снижением p95 задержки на 25%.
Адаптация идет стремительно: после объединения Chat, Work и Codex в единое десктопное приложение, число активных пользователей достигло 8 миллионов. Более 1 миллиона пользователей Codex уже используют его вне сферы разработки ПО, что сигнализирует о выходе AI-агентов в массовый сегмент.
SpaceXAI Grok 4.5: Синергия с Cursor
Модель обучалась на триллионах токенов данных Cursor (с учетом Privacy Mode), что дало ей преимущество в агентном программировании. Grok 4.5 показывает 29% прохождения сложных профессиональных задач (SWE Marathon), опережая GPT-5.5 и Opus 4.8. Однако модель требует контроля: уровень галлюцинаций на тесте AA-Omniscience составляет 54%, а на Benchmark CursorBench выявлено загрязнение данных.
Meta Muse Spark 1.1: Прорыв в Multi-Agent
Meta представила модель, специально обученную для работы в связке «ведущий агент — подчиненный агент». Muse Spark 1.1 улучшила индекс Artificial Analysis на 8 пунктов за три месяца. Модель демонстрирует отличные результаты в использовании инструментов (MCP Atlas: 88.1), но пока уступает лидерам в сложных кросс-приложений задачах (DeepSWE: 53.3). Meta признает, что текущая автономность недостаточна для полностью автоматизированных исследований.
Источник: Towards AI newsletter ↗
