Новый стандарт производительности: 1 648 TFLOPs на GPU
Компания NVIDIA объявила об установлении мирового рекорда в области предобучения больших языковых моделей (LLM) архитектуры Mixture of Experts (MoE). Используя серверную систему NVIDIA GB300 NVL72 и модель DeepSeek-V3 671B, инженерам удалось достичь показателя 1 648 TFLOPs на один графический процессор. Это значение демонстрирует эффективность полностью скоординированной инфраструктуры, где аппаратное обеспечение, сеть и программное обеспечение работают как единое целое.
Архитектура MoE: вычислительная эффективность против сетевых задержек
Модели типа MoE, такие как DeepSeek-V3, содержат 671 миллиард параметров, но активируют лишь около 37 миллиардов на каждый токен. Это обеспечивает высокую вычислительную эффективность, однако создает серьезные вызовы для сетевой инфраструктуры. Каждый слой модели требует диспетчеризации токенов к экспертам и сбора результатов через операцию all-to-all как в прямом, так и в обратном проходе. Именно эти коммуникационные паттерны становятся узким местом, определяющим общую пропускную способность.
Технические характеристики GB300 NVL72
Система GB300 NVL72 спроектирована для решения двухуровневой задачи масштабирования. Внутри стойки (scale-up) используется пятая генерация NVLink, обеспечивающая низкую задержку и семантику памяти, а между стойками (scale-out) применяются сетевые адаптеры ConnectX-8 и коммутаторы InfiniBand/Ethernet.
| Параметр | Значение / Характеристика |
|---|---|
| Модель для тестирования | DeepSeek-V3 671B (MoE) |
| Рекордная производительность | 1 648 TFLOPs на GPU |
| Полоса пропускания NVLink (на GPU) | 1.8 TB/s |
| Пропускная способность all-to-all (на стойку) | 130 TB/s (non-blocking) |
| Скорость сетевого адаптера (Scale-out) | 800 Gbps (ConnectX-8 SuperNIC) |
| Масштабирование (256 → 1024 GPU) | Сохранение 97-98.5% производительности на GPU |
Роль программного обеспечения: от 3x до 10x прироста
Аппаратные возможности раскрываются благодаря оптимизациям в программном стеке. Использование NVIDIA Megatron Core позволило увеличить производительность в 3 раза по сравнению с предыдущим поколением GB200 NVL72. Кроме того, за шесть месяцев только за счет улучшений программного обеспечения производительность на том же оборудовании выросла еще в 1.5 раза.
Важную роль играют и открытые фреймворки. Оптимизации для TorchTitan (на базе PyTorch) дали прирост производительности примерно в 6 раз, а для JAX — почти в 10 раз за тот же период. Последняя версия JAX достигает 1 025 TFLOPs/GPU, что подтверждает эффективность совместной работы NVIDIA с сообществом разработчиков.
Значение для индустрии
Достижение 1 648 TFLOPs/GPU означает, что исследователи могут обучать более крупные модели и запускать больше экспериментов на той же инфраструктуре. Ключевым фактором успеха стало не просто увеличение пиковой производительности чипов, а устранение сетевых задержек в критическом пути обучения MoE-моделей, что позволяет эффективно масштабировать системы от 256 до 1 024 GPU без потери эффективности.
Источник: NVIDIA dev blog ↗
