Релиз модели12 августа 2026 г., 21:45 МСК🤖 Auto

Qwen3.8: 2.4T параметров и прорыв в агентах. Сравнение с GPT-5.6 и Claude

Alibaba Cloud выпустила Qwen3.8-Max — первую открытую модель уровня Qwen-Max с архитектурой MoE (2.4T/95B). Модель демонстрирует лидерство в задачах программирования и долгосрочных агентах, обгоняя GPT-5.6 Sol и Claude Opus 4.8.

Баннер новости 5638

Архитектура и ключевые характеристики

Qwen3.8-2.4T-A95B — это каузальная языковая модель, построенная на фундаменте Qwen3.5, но с существенными улучшениями. Это первая модель семейства Qwen, доступная в открытом доступе, которая соответствует уровню проприетарной Qwen-Max. Модель использует гибридную архитектуру, сочетающую Gated DeltaNet и Gated Attention, что позволяет эффективно обрабатывать длинные контексты и сложные вычисления.

Ключевые технические параметры:

  • Общее число параметров: 2.4 триллиона.
  • Активируемые параметры: 95 миллиардов (Mixture of Experts).
  • Количество слоев: 92.
  • Контекстное окно: 262,144 токенов нативно, с возможностью расширения до 1,010,000 токенов.
  • Векторное представление: 8192 скрытых измерений.

Модель поддерживает гибкое управление процессом мышления через параметры reasoning_effort и preserve_thinking, что критически важно для сложных многошаговых задач.

Результаты в программировании и агентах

Основной фокус Qwen3.8 — это автономное выполнение задач (agentic tasks). Модель демонстрирует выдающиеся результаты в бенчмарках, связанных с написанием кода, отладкой и созданием приложений. В частности, на терминальном бенчмарке Terminal Bench 2.1 Qwen3.8-Max набрал 86.6, что сопоставимо с Claude Opus 4.8 (84.6) и превосходит GPT-5.6 Sol (88.8 в некоторых конфигурациях, но с учетом нюансов оценки).

Важно отметить, что Qwen3.8-Max показывает стабильно высокие результаты в задачах, требующих долгосрочного планирования и взаимодействия с окружением, превосходя предыдущее поколение Qwen3.7-Max во многих метриках.

Сравнительная таблица бенчмарков

Ниже приведены результаты Qwen3.8-Max в сравнении с ключевыми конкурентами (Claude Opus 4.8, Fable 5, GPT-5.6 Sol) в наиболее значимых категориях:

Бенчмарк Opus 4.8 Fable 5 GPT 5.6 Sol Qwen3.7-Max Qwen3.8-Max
Terminal Bench 2.1 (Код/Терминал) 84.6 84.6 88.8 74.5 86.6
SWE-bench Pro (Программирование) 69.2 80.0 64.6 60.6 67.7
PaperBench (Исследования) 80.3 88.8 90.5 64.8 93.0
GPQA Diamond (Наука) 92.0 92.6 94.1 92.4 92.6
IFBench (Инструкции) 62.2 63.5 72.7 79.1 82.8
WideSearch (Поиск) 72.9 81.2 -- 75.2 81.9

Почему это важно для разработчиков

Релиз Qwen3.8-2.4T-A95B в формате Hugging Face Transformers открывает возможности для локального развертывания и кастомизации моделей уровня «фронтера». Поддержка популярных движков инференса, таких как vLLM, SGLang и TokenSpeed, позволяет интегрировать модель в существующие производственные стеки без необходимости использования облачных API.

Для пользователей, предпочитающих managed-решения, доступна официальная версия Qwen3.8-Max через Qwen Cloud, которая включает дополнительные функции: поддержку визуального ввода (vision input), расширенное контекстное окно до 1M токенов и встроенные инструменты (built-in tools). Это делает Qwen3.8 сильным конкурентом в сфере автономных AI-агентов, способных выполнять сложные многоэтапные задачи с высокой надежностью.

Бенчмарки

БенчмаркFable 5GPT 5.6 Sol (max)Opus 4.8Qwen3.7-Max
Terminal Bench 2.184.6%88.8%84.6%74.5%
SWE-bench Pro80%64.6%69.2%60.6%
GPQA Diamond92.6%94.1%92%92.4%
HLE53.3%47.2%45.7%41.4%
PaperBench88.8%90.5%80.3%64.8%
FrontierSWE88.8%70%40.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗