Релиз модели12 августа 2026 г., 21:30 МСК🤖 Auto

NVIDIA и Qwen3.8: 2.4 трлн параметров на GB300 NVL72

NVIDIA представила оптимизированную инфраструктуру для запуска крупнейшей открытой модели Qwen3.8-Max (2.4T параметров) на серверах GB300 NVL72, обеспечив пропускную способность свыше 4K токенов/с на GPU.

Баннер новости 5637

Масштаб и архитектура Qwen3.8-Max

Alibaba открыла веса модели Qwen3.8-2.4T-A95B (также известной как Qwen3.8-Max). Это самая крупная модель с открытыми весами на данный момент, использующая архитектуру fine-grained Mixture of Experts (MoE). Модель содержит 2.4 триллиона параметров, но активирует только 95 миллиардов на каждый токен. Архитектура сочетает полную и линейную внимательность (attention), что позволяет работать с контекстным окном до 1 миллиона токенов и генерировать ответы длиной до 128K токенов.

Производительность на NVIDIA GB300 NVL72

Для обслуживания такой модели требуется вычислительная мощность уровня дата-центра. NVIDIA продемонстрировала результаты развертывания модели на платформе GB300 NVL72, которая объединяет 72 GPU Blackwell Ultra в единую систему с пропускной способностью NVLink 130 ТБ/с. Ключевые метрики производительности в формате FP8:

Метрика Значение Примечание
Пропускная способность (Throughput) > 4,000 токенов/с На один GPU
Скорость для пользователя > 350 токенов/с При типичной нагрузке
Точность вычислений FP8 Оптимизация NVFP4 ожидается в будущем
Активные параметры 95B Из 2.4T общих параметров

Инженерные решения для длинного контекста

Модель спроектирована для сложных агентных задач (агентный ИИ), где накапливаются инструкции, логи и результаты работы инструментов. Для управления растущим объемом памяти KV-кэша используется гибридная архитектура: слои с полной внимательностью чередуются со слоями с линейной внимательностью, где KV-кэш заменяется ограниченным рекуррентным состоянием. Это позволяет удерживать вычислительные затраты и потребление памяти в пределах нормы даже при контексте в 1 млн токенов.

Гибкое управление рассуждениями

В модель встроены встроенные механизмы контроля рассуждений (reasoning controls) с уровнями low/high/xhigh. Разработчики могут настраивать глубину рассуждений для каждого запроса, балансируя между качеством ответа и пропускной способностью. Это позволяет использовать модель как для сложных многошаговых задач, так и для высокоскоростной обработки документов.

Инструментарий для разработчиков

NVIDIA предоставляет несколько путей для развертывания модели:

  • Inference Runtimes: Поддержка SGLang, vLLM и NVIDIA Dynamo.
  • NVIDIA NIM: Безмодельный контейнер для быстрого развертывания (Day-0 deployment).
  • Fine-tuning: Использование NVIDIA NeMo AutoModel для дообучения (SFT или LoRA) на базе весов из Hugging Face или ModelScope.

Модель доступна для скачивания на Hugging Face и ModelScope, а развертывание возможно через NGC.

Источник: NVIDIA dev blog ↗