Главная/Блог/Гайд/Запуск Qwen3.8-2.4T на NVIDIA GB300…
Гайд8 мин чтения · 13 августа 2026 г.

Запуск Qwen3.8-2.4T на NVIDIA GB300 NVL72: Эра Agentic AI

Разбираем архитектуру модели Qwen3.8-2.4T-A95B, особенности её развертывания на серверах NVIDIA GB300 NVL72 и новые возможности для Agentic AI с настраиваемым рассуждением.

Запуск Qwen3.8-2.4T на NVIDIA GB300 NVL72: Эра Agentic AI

Открытый мир больших языковых моделей (LLM) переживает очередной качественный скачок. Компания Alibaba недавно опубликовала веса своей самой крупной модели с открытым исходным кодом — Qwen3.8-2.4T-A95B (также известной как Qwen3.8-Max). Это не просто еще одна итерация в гонке параметров; это фундаментальный сдвиг в том, как мы подходим к сложным вычислительным задачам. Модель обладает 2,4 триллионами параметров, но при этом активирует лишь 95 миллиардов на каждый токен. Такая архитектура позволяет приблизить возможности закрытых флагманских решений к открытой экосистеме, обеспечивая производительность уровня frontier-моделей.

Однако масштаб модели диктует свои условия. Развертывание LLM с 2,4 триллионами параметров невозможно на стандартном потребительском оборудовании. Это требует вычислительных мощностей уровня дата-центра, экстремального со-дизайна на уровне чипов, системной архитектуры и программного обеспечения. NVIDIA, являясь ключевым игроком в этой сфере, уже подготовила инфраструктуру для работы с такими монстрами. В частности, платформа NVIDIA GB300 NVL72 стала первой, способной эффективно обслуживать эту модель «день в день» (Day-0) без дополнительной тонкой настройки.

В этой статье мы подробно разберем, что делает Qwen3.8-2.4T-A95B уникальной, как работает её гибридная архитектура внимания, почему 72-процессорный сервер GB300 NVL72 является идеальной средой для неё, и как разработчики могут использовать настраиваемое рассуждение для создания мощных Agentic AI приложений.

01Архитектурные инновации для работы с длинным контекстом

Чтобы понять, почему Qwen3.8-2.4T-A95B так важна, нужно заглянуть под капот её архитектуры. В отличие от традиционных чат-моделей, которые получают один промпт и выдают один ответ, современные Agentic AI (агентные ИИ-системы) работают совершенно иначе. Агенты выполняют многошаговые рабочие процессы: они пишут код, анализируют большие документы, взаимодействуют с внешними инструментами, сохраняют логи и накапливают контекст на протяжении всего сеанса.

По мере роста контекста (который в Qwen3.8 достигает 1 миллиона токенов), классические модели сталкиваются с тремя критическими ограничениями:

  1. Вычислительная сложность внимания: В стандартных слоях внимания каждый токен должен «смотреть» на каждый другой токен. Сложность растет квадратично, что делает обработку длинных контекстов непрактичной.
  2. Память KV-cache: Для хранения состояний ключей и значений (Key-Value cache) требуется огромные объемы видеопамяти, которые быстро исчерпываются.
  3. Пропускная способность: Передача данных между токенами становится узким местом.

Qwen3.8-2.4T-A95B решает эти проблемы с помощью гибридной архитектуры, сочетающей полные слои внимания (full attention) и линейные слои внимания (linear attention). Модель чередует эти два типа слоев. В слоях полного внимания каждый токен взаимодействует со всеми остальными, что обеспечивает высокую точность и глубину понимания. В слоях линейного внимания растущий KV-cache заменяется ограниченным рекуррентным состоянием. Это позволяет модели сохранять как вычислительные ресурсы, так и память в строгих пределах, даже когда контекст масштабируется до миллиона токенов.

Тонкозернистая смесь экспертов (Fine-Grained MoE)

Еще одной ключевой особенностью является архитектура Mixture of Experts (MoE). В модели 2,4 триллиона параметров, но для обработки одного токена активируется только 95 миллиардов. Это достигается за счет распределения вычислительной емкости не через несколько крупных «экспертов», а через большое количество мелких, специализированных модулей.

Обученный маршрутизатор (router) определяет, какие именно эксперты нужны для конкретного токена. Это дает два главных преимущества:

  1. Эффективность затрат: Стоимость обслуживания модели зависит от количества активированных параметров, а не от общего их числа. Это позволяет предоставлять возможности уровня 2,4 триллионов параметров по цене значительно более компактной модели.
  2. Специализация: Мелкие эксперты могут быть лучше обучены узким задачам, что повышает качество ответов.
💡
Важно знать. Активация только 95B параметров из 2.4T означает, что вы платите за «ум» модели, но не за её «вес». Это делает экономическую модель развертывания таких гигантов гораздо более привлекательной для бизнеса.

02Производительность на NVIDIA GB300 NVL72

Теоретическая архитектура — это одно, но реальная магия происходит при развертывании. Для работы с моделью такого масштаба требуется инфраструктура, способная обеспечить экстремально высокую пропускную способность связи между GPU. Здесь на сцену выходит NVIDIA GB300 NVL72.

GB300 NVL72 — это серверная архитектура уровня стойки (rack-scale), которая интегрирует 72 графических процессора NVIDIA Blackwell Ultra в единую платформу. Главная особенность этой системы — домен NVIDIA NVLink, объединяющий все 72 GPU. Это позволяет осуществлять эффективную коммуникацию типа «все-со-всеми» (all-to-all) со скоростью 130 ТБ/с.

Почему это критично для MoE-моделей? В архитектурах с смесью экспертов трафик данных между узлами (expert traffic) огромен. На традиционных сетях с использованием InfiniBand или Ethernet такие объемы данных создавали бы узкие места (bottlenecks). NVLink в GB300 NVL72 устраняет эту проблему, обеспечивая бесшовную передачу данных между экспертами, распределенными по разным GPU.

График производительности Qwen3.8-2.4T-A95B на NVIDIA GB300 NVL72, показывающий более 4K токенов в секунду
График производительности Qwen3.8-2.4T-A95B на NVIDIA GB300 NVL72, показывающий более 4K токенов в секунду

Результаты тестирования «день в день» (Day-0) впечатляют. Без какой-либо дополнительной тонкой настройки (post-training) модель Qwen3.8-2.4T-A95B, работающая на NVIDIA Blackwell GB300 NVL72 в формате FP8, демонстрирует следующие показатели:

  • Пропускная способность: Более 4000 токенов в секунду на один GPU.
  • Скорость для пользователя: Более 350 токенов в секунду на пользователя.

Такая производительность позволяет ИИ-фабрикам запускать модели с триллионами параметров в продакшене с высокой пропускной способностью и низкой задержкой. Это переводит Agentic AI из категории экспериментальных прототипов в разряд промышленных инструментов, способных обрабатывать тысячи запросов одновременно.

⚠️
Ожидания оптимизации. Указанные цифры достигнуты в формате FP8. Ожидается, что внедрение формата NVFP4 (NVIDIA FP4) принесет дополнительные приросты производительности и эффективности использования памяти в будущем, что сделает развертывание еще более экономичным.

03Настраиваемое рассуждение (Configurable Reasoning)

Одной из самых мощных функций Qwen3.8-2.4T-A95B является встроенный контроль над процессом рассуждения. Разработчики могут настраивать глубину рассуждения (reasoning depth) для каждого запроса, выбирая один из трех режимов:

  1. Low (Низкий): Для задач, требующих высокой пропускной способности и быстрой обработки документов, где глубокий анализ не критичен.
  2. High (Высокий): Баланс между скоростью и качеством для стандартных задач.
  3. XHigh (Экстремально высокий): Для сложных многошаговых задач, требующих глубокого логического вывода, например, отладки сложного кода или анализа юридических документов.

Эта гибкость позволяет разработчикам торговать вычислительными ресурсами за качество ответа. Если задача простая, вы экономите ресурсы, снижая режим рассуждения. Если задача сложная — вы увеличиваете вычислительную нагрузку, получая более точный и проработанный ответ. Это особенно важно для Agentic AI, где агент может сам решать, насколько глубоко нужно «думать» перед выполнением действия.

Визуализация кластера NVIDIA Vera Rubin Pod, демонстрирующего масштаб распределенных вычислений
Визуализация кластера NVIDIA Vera Rubin Pod, демонстрирующего масштаб распределенных вычислений

04Инструменты развертывания и оптимизации

NVIDIA предлагает экосистему инструментов, которые позволяют разработчикам максимально эффективно использовать Qwen3.8-2.4T-A95B. Подход гибкий: от готовых решений до полного контроля над процессом.

Инференс-стеки (Inference Stacks)

Для разработчиков, предпочитающих открытый код и максимальный контроль, доступны следующие оптимизированные решения:

  • SGLang: Высокопроизводительный фреймворк для развертывания LLM.
  • vLLM: Популярный движок инференса, известный своей эффективностью управления памятью (PagedAttention).
  • NVIDIA Dynamo: Оптимизированное ядро для ускорения инференса на архитектуре Blackwell.

Эти инструменты предоставляют готовые рецепты (recipes) для распределенного обслуживания модели, позволяя разработчикам тонко настраивать производительность под свои нужды.

NVIDIA NIM (NVIDIA Inference Microservices)

Для тех, кто хочет быстрее выйти на рынок, NVIDIA предлагает model-free NVIDIA NIM. Это единый контейнер инференса, который может обслуживать любую поддерживаемую модель. Вы просто загружаете веса модели и разворачиваете их на Day-0. NIM абстрагирует сложность распределенного развертывания, позволяя масштабировать модель до продакшена без написания сложного кода для оркестрации.

Серверная стойка LPX Rack, являющаяся частью инфраструктуры для развертывания крупных ИИ-моделей
Серверная стойка LPX Rack, являющаяся частью инфраструктуры для развертывания крупных ИИ-моделей

Пост-обучение (Post-Training) с NVIDIA NeMo

Если вам нужно адаптировать Qwen3.8 под конкретную доменную область (например, медицинскую или финансовую), вы можете использовать NVIDIA NeMo AutoModel. Это библиотека для тонкой настройки (fine-tuning) на базе PyTorch, которая поддерживает работу с чекпоинтами Hugging Face «день в день».

NeMo позволяет:

  • Тренировать модель напрямую на существующих чекпоинтах без необходимости конвертации весов.
  • Использовать полный Supervised Fine-Tuning (SFT) для максимального контроля.
  • Применять эффективные по памяти методы, такие как LoRA (Low-Rank Adaptation), что значительно снижает требования к ресурсам для дообучения.

05Что это значит на практике

Синтезируя все вышесказанное, мы видим, что появление Qwen3.8-2.4T-A95B и её поддержка на GB300 NVL72 знаменуют собой переход Agentic AI от нишевых экспериментов к промышленной зрелости.

Для разработчиков: Теперь у вас есть доступ к модели, которая может обрабатывать контекст в миллион токенов. Это означает, что вы можете загрузить в память целую библиотеку документации, историю всех коммитов в репозитории или годовой отчет компании, и агент сможет работать с этими данными как с единым целым. Гибридная архитектура внимания и MoE делают это возможным без катастрофического падения скорости.

Для бизнеса: Настраиваемое рассуждение позволяет оптимизировать затраты. Вы не платите за «глубокое мышление» при обработке простых запросов, но получаете его, когда это необходимо. Высокая пропускная способность на GB300 NVL72 (4K токенов/с на GPU) означает, что вы можете обслуживать тысячи пользователей одновременно, что делает такие решения экономически viable для крупных корпоративных внедрений.

Для экосистемы: Открытые веса Qwen3.8-2.4T-A95B стимулируют инновации. Разработчики могут исследовать новые архитектуры, экспериментировать с методами тонкой настройки через NeMo и создавать новые приложения, которые ранее были невозможны из-за ограничений закрытых моделей или вычислительной стоимости.

Графическое представление архитектуры или процесса обработки запросов в контексте Agentic AI
Графическое представление архитектуры или процесса обработки запросов в контексте Agentic AI

В заключение, сочетание мощной архитектуры Qwen3.8, оптимизированной для длинного контекста и MoE, с инфраструктурой NVIDIA GB300 NVL72, способной обеспечить экстремальную пропускную способность, создает новый стандарт для развертывания больших языковых моделей. Это не просто улучшение производительности; это изменение парадигмы в том, как мы строим интеллектуальные системы следующего поколения.

Если вы планируете работать с моделями такого масштаба, рекомендуется начать с загрузки весов с Hugging Face или ModelScope и развертывания через NVIDIA NIM для быстрого старта, а затем переходить к более сложным оптимизациям с использованием SGLang, vLLM или NeMo по мере необходимости.

Источник: NVIDIA Developer ↗