Релиз модели21 июля 2026 г., 19:31 МСК🤖 Auto

NVIDIA GB300 NVL72: мировой рекорд обучения MoE-моделей

NVIDIA установила новый мировой рекорд производительности при предобучении модели DeepSeek-V3 671B на системе GB300 NVL72, достигнув 1 648 TFLOPs на GPU.

Баннер новости 4058

Новый стандарт производительности: 1 648 TFLOPs на GPU

Компания NVIDIA объявила об установлении мирового рекорда в области предобучения больших языковых моделей (LLM) архитектуры Mixture of Experts (MoE). Используя серверную систему NVIDIA GB300 NVL72 и модель DeepSeek-V3 671B, инженерам удалось достичь показателя 1 648 TFLOPs на один графический процессор. Это значение демонстрирует эффективность полностью скоординированной инфраструктуры, где аппаратное обеспечение, сеть и программное обеспечение работают как единое целое.

Архитектура MoE: вычислительная эффективность против сетевых задержек

Модели типа MoE, такие как DeepSeek-V3, содержат 671 миллиард параметров, но активируют лишь около 37 миллиардов на каждый токен. Это обеспечивает высокую вычислительную эффективность, однако создает серьезные вызовы для сетевой инфраструктуры. Каждый слой модели требует диспетчеризации токенов к экспертам и сбора результатов через операцию all-to-all как в прямом, так и в обратном проходе. Именно эти коммуникационные паттерны становятся узким местом, определяющим общую пропускную способность.

Технические характеристики GB300 NVL72

Система GB300 NVL72 спроектирована для решения двухуровневой задачи масштабирования. Внутри стойки (scale-up) используется пятая генерация NVLink, обеспечивающая низкую задержку и семантику памяти, а между стойками (scale-out) применяются сетевые адаптеры ConnectX-8 и коммутаторы InfiniBand/Ethernet.

Параметр Значение / Характеристика
Модель для тестирования DeepSeek-V3 671B (MoE)
Рекордная производительность 1 648 TFLOPs на GPU
Полоса пропускания NVLink (на GPU) 1.8 TB/s
Пропускная способность all-to-all (на стойку) 130 TB/s (non-blocking)
Скорость сетевого адаптера (Scale-out) 800 Gbps (ConnectX-8 SuperNIC)
Масштабирование (256 → 1024 GPU) Сохранение 97-98.5% производительности на GPU

Роль программного обеспечения: от 3x до 10x прироста

Аппаратные возможности раскрываются благодаря оптимизациям в программном стеке. Использование NVIDIA Megatron Core позволило увеличить производительность в 3 раза по сравнению с предыдущим поколением GB200 NVL72. Кроме того, за шесть месяцев только за счет улучшений программного обеспечения производительность на том же оборудовании выросла еще в 1.5 раза.

Важную роль играют и открытые фреймворки. Оптимизации для TorchTitan (на базе PyTorch) дали прирост производительности примерно в 6 раз, а для JAX — почти в 10 раз за тот же период. Последняя версия JAX достигает 1 025 TFLOPs/GPU, что подтверждает эффективность совместной работы NVIDIA с сообществом разработчиков.

Значение для индустрии

Достижение 1 648 TFLOPs/GPU означает, что исследователи могут обучать более крупные модели и запускать больше экспериментов на той же инфраструктуре. Ключевым фактором успеха стало не просто увеличение пиковой производительности чипов, а устранение сетевых задержек в критическом пути обучения MoE-моделей, что позволяет эффективно масштабировать системы от 256 до 1 024 GPU без потери эффективности.

Источник: NVIDIA dev blog ↗