Релиз модели8 сентября 2026 г., 07:46 МСК🤖 Auto

GPT-6 Astra догнала Claude 5.1 за 4 дня: новый лидер AIKraft

OpenAI выпустила GPT-6 Astra, которая за четыре дня обогнала Claude Fable 5.1 по индексу интеллекта. Анализ Artificial Analysis показывает сдвиг в парето-оптимуме: качество растет, но цена за задачу остается ключевым барьером.

Баннер новости 6992

Резкий рывок GPT-6 Astra

Лаборатория Artificial Analysis опубликовала данные по обновленному Intelligence Index v4.3, где ключевым событием стала оценка новой модели GPT-6 Astra от OpenAI. Модель представлена в нескольких вариациях усилий (low, medium, high, xhigh, max), что позволяет гибко настраивать баланс между скоростью и точностью. За четыре дня после анонса GPT-6 Astra смогла догнать и сравняться с показателями Claude Fable 5.1 от Anthropic, став новым эталоном в сегменте проприетарных моделей.

Методология Intelligence Index v4.3

Индекс интеллекта v4.3 претерпел изменения: бенчмарк τ³-Banking заменен на AutomationBench-AA, а Terminal-Bench обновлен до версии 4.0. Оценка проводится по 10 ключевым направлениям, включая научное кодирование (SciCode), проверку на человеческие ценности (Humanity's Last Exam) и сложные агентные задачи. Всего в базе данных анализируется 644 модели, но в фокусе остаются 24 флагмана.

Сравнение лидеров рынка

Анализ показывает, что гонка вооружений смещается не только в сторону интеллекта, но и в сторону эффективности затрат. Ниже приведены сравнительные характеристики топовых моделей по ключевым метрикам Intelligence Index:

Модель Разработчик Индекс Интеллекта (v4.3) Стоимость за задачу (USD) Статус
GPT-6 Astra (max) OpenAI Высокий (лидер парето) Высокая Proprietary
Claude Fable 5.1 Anthropic Высокий (догнана) Средняя Proprietary
Muse Spark 1.3 Meta Frontier-уровень Низкая Open Weights
Gemini 3.8 Flash Google Высокий (4-я Flash-версия) Очень низкая Proprietary

Экономика AI: Парето-оптимум

Графики зависимости «Интеллект vs Стоимость» показывают, что OpenAI и Anthropic находятся в «самой привлекательной четверти» (most attractive quadrant) по соотношению качества и цены для тяжелых задач. Однако модели от Meta (Muse Spark 1.3) и Google (Gemini 3.8 Flash) предлагают более выгодные условия для массового внедрения, особенно учитывая, что Gemini 3.8 Flash стала четвертой Flash-моделью Google менее чем за четыре месяца.

Другие важные обновления

  • OpenBMB MiniCPM5-2B: Опубликована новая легковесная модель с открытыми весами, ориентированная на эффективное развертывание.
  • K2 Horizon 375B A23B: Новая архитектура от Thinking Machines, привлекающая внимание своим масштабом.
  • Coding Agent Index: Обновлены данные по агентам для программирования, где Composite average pass@1 рассчитывается на основе DeepSWE, Terminal-Bench v2.1 и SWE-Atlas-QnA.

Источник: Artificialanalysis ↗