Резкий рывок GPT-6 Astra
Лаборатория Artificial Analysis опубликовала данные по обновленному Intelligence Index v4.3, где ключевым событием стала оценка новой модели GPT-6 Astra от OpenAI. Модель представлена в нескольких вариациях усилий (low, medium, high, xhigh, max), что позволяет гибко настраивать баланс между скоростью и точностью. За четыре дня после анонса GPT-6 Astra смогла догнать и сравняться с показателями Claude Fable 5.1 от Anthropic, став новым эталоном в сегменте проприетарных моделей.
Методология Intelligence Index v4.3
Индекс интеллекта v4.3 претерпел изменения: бенчмарк τ³-Banking заменен на AutomationBench-AA, а Terminal-Bench обновлен до версии 4.0. Оценка проводится по 10 ключевым направлениям, включая научное кодирование (SciCode), проверку на человеческие ценности (Humanity's Last Exam) и сложные агентные задачи. Всего в базе данных анализируется 644 модели, но в фокусе остаются 24 флагмана.
Сравнение лидеров рынка
Анализ показывает, что гонка вооружений смещается не только в сторону интеллекта, но и в сторону эффективности затрат. Ниже приведены сравнительные характеристики топовых моделей по ключевым метрикам Intelligence Index:
| Модель | Разработчик | Индекс Интеллекта (v4.3) | Стоимость за задачу (USD) | Статус |
|---|---|---|---|---|
| GPT-6 Astra (max) | OpenAI | Высокий (лидер парето) | Высокая | Proprietary |
| Claude Fable 5.1 | Anthropic | Высокий (догнана) | Средняя | Proprietary |
| Muse Spark 1.3 | Meta | Frontier-уровень | Низкая | Open Weights |
| Gemini 3.8 Flash | Высокий (4-я Flash-версия) | Очень низкая | Proprietary |
Экономика AI: Парето-оптимум
Графики зависимости «Интеллект vs Стоимость» показывают, что OpenAI и Anthropic находятся в «самой привлекательной четверти» (most attractive quadrant) по соотношению качества и цены для тяжелых задач. Однако модели от Meta (Muse Spark 1.3) и Google (Gemini 3.8 Flash) предлагают более выгодные условия для массового внедрения, особенно учитывая, что Gemini 3.8 Flash стала четвертой Flash-моделью Google менее чем за четыре месяца.
Другие важные обновления
- OpenBMB MiniCPM5-2B: Опубликована новая легковесная модель с открытыми весами, ориентированная на эффективное развертывание.
- K2 Horizon 375B A23B: Новая архитектура от Thinking Machines, привлекающая внимание своим масштабом.
- Coding Agent Index: Обновлены данные по агентам для программирования, где Composite average pass@1 рассчитывается на основе DeepSWE, Terminal-Bench v2.1 и SWE-Atlas-QnA.
Источник: Artificialanalysis ↗
