В мире искусственного интеллекта, где гонка за производительностью не знает границ, каждый новый архитектурный прорыв переписывает правила игры. 21 июля 2026 года NVIDIA официально объявила о достижении мирового рекорда в области предварительного обучения (pre-training) моделей с архитектурой Mixture of Experts (MoE). Используя новую систему NVIDIA GB300 NVL72, инженерам удалось достичь показателя 1 648 TFLOPs на один GPU при обучении модели DeepSeek-V3 с 671 миллиардом параметров. Это не просто сухая цифра в пресс-релизе; это маркер новой эры, где вычислительная мощность больше не является единственным ограничивающим фактором. На первый план выходит коммуникация между тысячами чипов, и именно здесь NVIDIA продемонстрировала, как должна выглядеть идеальная ко-дизайн-система.
Почему это важно для разработчиков и исследователей в России и по всему миру? Потому что эффективность масштабирования MoE-моделей напрямую определяет стоимость и время вывода на рынок новых фундаментальных моделей. Если раньше добавление GPU приводило к линейному росту производительности, то в эпоху больших моделей узким местом стала сеть. GB300 NVL72 решает эту проблему на уровне железа и софта, обеспечивая пропускную способность, которая позволяет скрывать задержки коммуникации за вычислениями. В этой статье мы подробно разберем, как устроена эта система, почему MoE требует совершенно иного подхода к сетевой инфраструктуре и какие программные оптимизации позволили достичь кратного прироста производительности по сравнению с предыдущим поколением.
01Эволюция архитектуры: Почему MoE меняет всё
Чтобы понять масштаб достижения, необходимо разобраться в фундаментальном сдвиге, который произошел в архитектуре больших языковых моделей (LLM). Долгое время индустрия опиралась на «плотные» (dense) модели, где каждый токен обрабатывался всеми параметрами сети. Это означало, что вычислительная нагрузка на один токен росла пропорционально общему количеству параметров. Однако такой подход стал экономически и вычислительно неэффективным для моделей с триллионами параметров.
На смену пришли модели с архитектурой Mixture of Experts (MoE). В таких моделях, как DeepSeek-V3, общее количество параметров может достигать 671 миллиарда, но для обработки каждого конкретного токена активируется лишь небольшая их часть — около 37 миллиардов. Это позволяет достигать уровня интеллекта, сопоставимого с гораздо более крупными плотными моделями, но при значительно меньших затратах вычислений на токен. Однако эта эффективность имеет свою цену: сложность переносится с вычислений на коммуникацию.

В MoE-архитектуре «эксперты» (подсети нейронных сетей) распределены по разным GPU. Для каждого токена система должна определить, к какому эксперту его направить, отправить данные, получить результат и собрать их обратно. Этот процесс требует паттерна коммуникации «all-to-all» (все-ко-всем) как в прямом, так и в обратном проходе (backpropagation). Поскольку эта операция происходит на каждом слое модели на каждом шаге обучения, даже крошечные задержки в сети суммируются. Если коммуникация не может быть скрыта за вычислениями, добавление новых GPU перестает увеличивать общую пропускную способность системы, и обучение встает в тупик.
02GB300 NVL72: Архитектура, созданная для связи
Проблема двухуровневой коммуникации — жесткая связь внутри стойки (scale-up) и более легкая, но предсказуемая связь между стойками (scale-out) — требует системного решения, а не просто более быстрого процессора. NVIDIA GB300 NVL72 спроектирована как единая платформа, где кремний, межсоединения, сеть и программное обеспечение оптимизированы совместно.
В основе системы лежит межсоединение пятого поколения NVIDIA NVLink. Оно обеспечивает каждому GPU пропускную способность 1,8 ТБ/с. Но еще важнее то, что вся стойка из 72 GPU Blackwell Ultra обладает неблокирующей all-to-all пропускной способностью в 130 ТБ/с. Это означает, что любой GPU может связаться с любым другим GPU в стойке за один шаг (single hop), без задержек, связанных с маршрутизацией через коммутаторы.

Ключевым отличием NVLink является его семантика памяти. В отличие от традиционных сетевых протоколов, где данные копируются из памяти одного устройства в буфер отправки, а затем отправляются, NVLink позволяет GPU читать и записывать данные в HBM (High Bandwidth Memory) другого GPU напрямую, как если бы это были собственные локальные операции загрузки и выгрузки. Это аппаратная операция, а не программный вызов отправки. Отсутствие программного стека в пути данных минимизирует задержки, а операции редукции (aggregation) выполняются внутри самого коммутатора NVLink по мере прохождения данных. Это критически важно для тензорного параллелизма и MoE-взаимодействий, которые должны оставаться внутри стойки с максимальной скоростью.
03Масштабирование и сеть: ConnectX-8 и InfiniBand
Одной стойки из 72 GPU недостаточно для обучения моделей такого масштаба. Необходима связь между множеством стоек (scale-out). Здесь в игру вступают сетевые адаптеры NVIDIA ConnectX-8 SuperNIC со скоростью 800 Гбит/с на GPU. Они соединяются через коммутаторы NVIDIA Quantum-X800 InfiniBand или Ethernet-решения Spectrum-X.

Задача scale-out сети — быть предсказуемой. Трафик градиентов, который передается между стойками, менее интенсивен, чем внутристойковый трафик, но он должен завершаться строго в рамках окна вычислений. Если какая-то связь окажется «бутылочным горлышком», это замедлит весь шаг обучения. GB300 NVL72 обеспечивает такую предсказуемость, позволяя графическим процессорам продолжать вычисления, пока сеть обрабатывает коммуникационные задачи. Это достигается за счет изолированной доменной обработки инфраструктуры с помощью NVIDIA BlueField DPU, которые берут на себя задачи виртуальной сети, безопасности и управления жизненным циклом, разгружая хост-процессоры.
04Программный стек: Megatron Core, TorchTitan и JAX
Железо само по себе не создает рекорды. Ключевую роль играет программное обеспечение, которое извлекает максимум из архитектуры. NVIDIA активно участвует в разработке открытых фреймворков, обеспечивая их оптимизацию для своих платформ. В тестировании DeepSeek-V3 671B участвовали три основных движка: проприетарный NVIDIA Megatron Core, а также открытые TorchTitan (на базе PyTorch) и JAX.
Результаты впечатляют. При использовании 256 GPU с фреймворком Megatron Core, GB300 NVL72 достигла 1 648 TFLOPs на GPU. Для сравнения, предыдущее поколение GB200 NVL72 с ранними версиями программного обеспечения показывало всего 606 TFLOPs. Это означает рост производительности почти в 3 раза всего за одно поколение аппаратного обеспечения.

Но на этом оптимизация не остановилась. За шесть месяцев после выхода системы, благодаря исключительно программным улучшениям (без изменения железа), производительность на той же стойке GB300 NVL72 выросла еще на 50% (1.5x). Это доказывает, что платформа находится в стадии активного развития, и ее потенциал раскрывается по мере совершенствования алгоритмов распределения памяти и графов вычислений.
05Вклад открытых фреймворков: TorchTitan и JAX
Особое внимание стоит уделить вкладу сообщества и NVIDIA в развитие открытых стандартов. TorchTitan, нативный стек обучения PyTorch, получил значительные оптимизации от инженеров NVIDIA. На модели DeepSeek-V3 671B эти улучшения позволили увеличить delivered performance (фактическую производительность) в 6 раз по сравнению с базовыми настройками.
Аналогичная картина наблюдается в экосистеме JAX. За тот же шестимесячный период оптимизации JAX позволили увеличить производительность почти в 10 раз. Последняя версия программного обеспечения достигла пропускной способности 1 025 TFLOPs/GPU. Эти цифры демонстрируют, что «сырое» железо — это лишь фундамент. Без глубокой интеграции с фреймворками, таких как использование CUDA Graphs и кастомных ядер слияния (fusion kernels), достичь таких показателей невозможно.
06Масштабирование от 256 до 1024 GPU
Самый важный тест для любой распределенной системы — это линейность масштабирования. Способна ли система сохранить эффективность при увеличении количества GPU в 4 раза? Результаты GB300 NVL72 здесь выдающиеся.
При масштабировании обучения DeepSeek-V3 с 256 до 1 024 GPU, фреймворк Megatron Core сохранил 98,5% своей производительности на один GPU. TorchTitan и JAX сохранили 97%. Это означает, что почти вся добавленная инфраструктура превращается в добавленную системную пропускную способность (tokens per second). Сеть scale-out справляется с градиентным трафиком так эффективно, что добавление новых GPU строго увеличивает общую скорость обучения, не замедляясь из-за накладных расходов на коммуникацию.

Это достигается благодаря 800 Гбит/с сетям на GPU, которые позволяют скрыть трафик градиентов за вычислениями. В предыдущих поколениях добавление GPU часто приводило к убывающей отдаче из-за перегрузки сети. GB300 NVL72 решает эту проблему на архитектурном уровне.
07Что это значит на практике
Для исследователей и компаний, работающих с AI, эти цифры означают несколько практических преимуществ. Во-первых, сокращение времени обучения. То, что раньше требовало недель на кластере из тысяч GPU, теперь можно сделать быстрее и с меньшим количеством ресурсов. Это позволяет проводить больше экспериментов, итерировать гипотезы быстрее и находить оптимальные архитектуры моделей.
Во-вторых, экономическая эффективность. Хотя стоимость оборудования GB300 NVL72 высока, стоимость обучения одной модели (cost per model) снижается за счет кратного роста производительности. Это делает передовой AI более доступным для организаций, которые могут позволить себе такие кластеры.
В-третьих, доступность через облака и локальные развертывания. Для российских специалистов важно понимать, что архитектура NVLink и принципы масштабирования остаются актуальными. Хотя прямые поставки оборудования могут быть ограничены, понимание этих принципов критично для работы с существующими кластерами на базе NVIDIA A100/H100 и для планирования миграции на более новые архитектуры, когда это станет возможным. Оптимизация кода под Megatron Core и JAX, а также использование техник, описанных в статье (например, fusion kernels), применимы к любым современным GPU NVIDIA.
В заключение, мировой рекорд NVIDIA GB300 NVL72 — это не просто маркетинговый ход. Это демонстрация того, как глубокая ко-дизайн-интеграция железа и софта решает фундаментальные проблемы масштабирования AI. По мере того как модели становятся больше, а требования к данным растут, именно такая целостная архитектура станет стандартом для создания следующего поколения искусственного интеллекта.
Источник: NVIDIA Developer ↗
