Масштаб и архитектура Qwen3.8-Max
Alibaba открыла веса модели Qwen3.8-2.4T-A95B (также известной как Qwen3.8-Max). Это самая крупная модель с открытыми весами на данный момент, использующая архитектуру fine-grained Mixture of Experts (MoE). Модель содержит 2.4 триллиона параметров, но активирует только 95 миллиардов на каждый токен. Архитектура сочетает полную и линейную внимательность (attention), что позволяет работать с контекстным окном до 1 миллиона токенов и генерировать ответы длиной до 128K токенов.
Производительность на NVIDIA GB300 NVL72
Для обслуживания такой модели требуется вычислительная мощность уровня дата-центра. NVIDIA продемонстрировала результаты развертывания модели на платформе GB300 NVL72, которая объединяет 72 GPU Blackwell Ultra в единую систему с пропускной способностью NVLink 130 ТБ/с. Ключевые метрики производительности в формате FP8:
| Метрика | Значение | Примечание |
|---|---|---|
| Пропускная способность (Throughput) | > 4,000 токенов/с | На один GPU |
| Скорость для пользователя | > 350 токенов/с | При типичной нагрузке |
| Точность вычислений | FP8 | Оптимизация NVFP4 ожидается в будущем |
| Активные параметры | 95B | Из 2.4T общих параметров |
Инженерные решения для длинного контекста
Модель спроектирована для сложных агентных задач (агентный ИИ), где накапливаются инструкции, логи и результаты работы инструментов. Для управления растущим объемом памяти KV-кэша используется гибридная архитектура: слои с полной внимательностью чередуются со слоями с линейной внимательностью, где KV-кэш заменяется ограниченным рекуррентным состоянием. Это позволяет удерживать вычислительные затраты и потребление памяти в пределах нормы даже при контексте в 1 млн токенов.
Гибкое управление рассуждениями
В модель встроены встроенные механизмы контроля рассуждений (reasoning controls) с уровнями low/high/xhigh. Разработчики могут настраивать глубину рассуждений для каждого запроса, балансируя между качеством ответа и пропускной способностью. Это позволяет использовать модель как для сложных многошаговых задач, так и для высокоскоростной обработки документов.
Инструментарий для разработчиков
NVIDIA предоставляет несколько путей для развертывания модели:
- Inference Runtimes: Поддержка SGLang, vLLM и NVIDIA Dynamo.
- NVIDIA NIM: Безмодельный контейнер для быстрого развертывания (Day-0 deployment).
- Fine-tuning: Использование NVIDIA NeMo AutoModel для дообучения (SFT или LoRA) на базе весов из Hugging Face или ModelScope.
Модель доступна для скачивания на Hugging Face и ModelScope, а развертывание возможно через NGC.
Источник: NVIDIA dev blog ↗
