Архитектура и ключевые характеристики
Qwen3.8-2.4T-A95B — это каузальная языковая модель, построенная на фундаменте Qwen3.5, но с существенными улучшениями. Это первая модель семейства Qwen, доступная в открытом доступе, которая соответствует уровню проприетарной Qwen-Max. Модель использует гибридную архитектуру, сочетающую Gated DeltaNet и Gated Attention, что позволяет эффективно обрабатывать длинные контексты и сложные вычисления.
Ключевые технические параметры:
- Общее число параметров: 2.4 триллиона.
- Активируемые параметры: 95 миллиардов (Mixture of Experts).
- Количество слоев: 92.
- Контекстное окно: 262,144 токенов нативно, с возможностью расширения до 1,010,000 токенов.
- Векторное представление: 8192 скрытых измерений.
Модель поддерживает гибкое управление процессом мышления через параметры reasoning_effort и preserve_thinking, что критически важно для сложных многошаговых задач.
Результаты в программировании и агентах
Основной фокус Qwen3.8 — это автономное выполнение задач (agentic tasks). Модель демонстрирует выдающиеся результаты в бенчмарках, связанных с написанием кода, отладкой и созданием приложений. В частности, на терминальном бенчмарке Terminal Bench 2.1 Qwen3.8-Max набрал 86.6, что сопоставимо с Claude Opus 4.8 (84.6) и превосходит GPT-5.6 Sol (88.8 в некоторых конфигурациях, но с учетом нюансов оценки).
Важно отметить, что Qwen3.8-Max показывает стабильно высокие результаты в задачах, требующих долгосрочного планирования и взаимодействия с окружением, превосходя предыдущее поколение Qwen3.7-Max во многих метриках.
Сравнительная таблица бенчмарков
Ниже приведены результаты Qwen3.8-Max в сравнении с ключевыми конкурентами (Claude Opus 4.8, Fable 5, GPT-5.6 Sol) в наиболее значимых категориях:
| Бенчмарк | Opus 4.8 | Fable 5 | GPT 5.6 Sol | Qwen3.7-Max | Qwen3.8-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 (Код/Терминал) | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro (Программирование) | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| PaperBench (Исследования) | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| GPQA Diamond (Наука) | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| IFBench (Инструкции) | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| WideSearch (Поиск) | 72.9 | 81.2 | -- | 75.2 | 81.9 |
Почему это важно для разработчиков
Релиз Qwen3.8-2.4T-A95B в формате Hugging Face Transformers открывает возможности для локального развертывания и кастомизации моделей уровня «фронтера». Поддержка популярных движков инференса, таких как vLLM, SGLang и TokenSpeed, позволяет интегрировать модель в существующие производственные стеки без необходимости использования облачных API.
Для пользователей, предпочитающих managed-решения, доступна официальная версия Qwen3.8-Max через Qwen Cloud, которая включает дополнительные функции: поддержку визуального ввода (vision input), расширенное контекстное окно до 1M токенов и встроенные инструменты (built-in tools). Это делает Qwen3.8 сильным конкурентом в сфере автономных AI-агентов, способных выполнять сложные многоэтапные задачи с высокой надежностью.
Бенчмарки
| Бенчмарк | Fable 5 | GPT 5.6 Sol (max) | Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 84.6% | 88.8% | 84.6% | 74.5% |
| SWE-bench Pro | 80% | 64.6% | 69.2% | 60.6% |
| GPQA Diamond | 92.6% | 94.1% | 92% | 92.4% |
| HLE | 53.3% | 47.2% | 45.7% | 41.4% |
| PaperBench | 88.8% | 90.5% | 80.3% | 64.8% |
| FrontierSWE | 88.8% | — | 70% | 40.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
