Релиз модели15 сентября 2026 г., 20:31 МСК🤖 Auto

MoE против Dense: NVIDIA объяснила, почему Nemotron 3.5 Lightning быстрее Gemma 4

NVIDIA опубликовала детальное сравнение архитектур Dense и MoE на примере Nemotron 3.5 Lightning. Модель с 30 млрд параметров активирует лишь 3 млрд, что обеспечивает рекордную пропускную способность при сниженных затратах на вывод.

Баннер новости 7562

Архитектурный сдвиг: от Dense к MoE

Ключевое отличие между плотными (Dense) и разреженными (Mixture-of-Experts, MoE) моделями заключается в использовании параметров. В Dense-моделях, таких как Gemma 4 31B, каждый токен обрабатывается всеми 31 миллиардом параметров через единый блок feed-forward network (FFN). В MoE-архитектуре, используемой в Nemotron 3.5 Lightning, один токен маршрутизируется через выбранный подмножество экспертов (в данном случае 3 из 30 млрд параметров), что радикально снижает вычислительную нагрузку на каждый шаг.

Важно отметить, что в Nemotron 3.5 Lightning применяется гибридная структура Mamba-2 + MoE + Attention. Слои Mamba-2 заменяют механизм внимания в большинстве слоев, поддерживая постоянное состояние рекуррентности вместо растущего KV-cache. Это не только ускоряет обработку длинных контекстов, но и оптимизирует использование памяти GPU.

Декорреляция памяти и вычислений

MoE-модели разрывают прямую связь между объемом памяти (VRAM) и вычислительной мощностью (FLOPs). Все эксперты загружаются в видеопамять заранее (фиксированные затраты памяти), но вычисления происходят только для активных экспертов (переменные затраты вычислений). Это позволяет достигать высокой пропускной способности (throughput), так как GPU не тратит время на чтение весов всех параметров для каждого токена.

Однако при высокой конкурентности (большом batch size) преимущество MoE в задержке (latency) сужается, так как токены коллективно используют большинство экспертов, а накладные расходы на маршрутизацию и перемещение данных становятся заметнее.

Сравнительные метрики: Nemotron 3.5 Lightning vs Gemma 4 31B

Сравнение двух моделей с примерно одинаковым общим количеством параметров (~30-31B) наглядно демонстрирует преимущества гибридной MoE-архитектуры NVIDIA. Несмотря на то, что Gemma 4 является мультимодальной моделью, Nemotron 3.5 Lightning показывает значительно более высокие скорости генерации и лучшую экономическую эффективность.

Параметр Gemma 4 31B (Dense) Nemotron 3.5 Lightning (MoE Hybrid)
Архитектура Dense; мультимодальная MoE; Mamba-2 + Attention; гибридная
Общее число параметров 31B 30B
Активные параметры на токен 31B (все) 3B (выборочно)
Потребление VRAM (нативное) ~61 GB Информация недостаточна
Потребление VRAM (4-bit) Информация недостаточна Информация недостаточна
Скорость вывода (Output speed) Ниже (диапазоны не пересекаются с Lightning) Выше (за счет активации 3B параметров и speculative decoding)
Стоимость ($/M output) Выше Ниже

Практические рекомендации по выбору

Выбор между Dense и MoE моделями должен основываться не на количестве параметров, а на инфраструктурных ограничениях:

  • Память GPU: MoE требует загрузки всех экспертов в VRAM, что может ограничивать размер KV-cache при высоких нагрузках. Dense-модели более предсказуемы в использовании памяти.
  • Конкурентность: При низких нагрузках (batch size 1) MoE выигрывает за счет меньшего чтения весов. При высоких нагрузках разница в задержке сокращается.
  • Дообучение (Fine-tuning): MoE-модели требуют осторожности для избежания дисбаланса маршрутизатора (router imbalance). Квантование также влияет на слои маршрутизации и проекции иначе, чем на компоненты Dense-моделей.

Для оценки производительности Nemotron 3.5 Lightning NVIDIA рекомендует использовать платформу build.nvidia.com, скачивать веса с Hugging Face для локального развертывания или обращаться через API OpenRouter.

Источник: NVIDIA dev blog ↗