Релиз модели9 июля 2026 г., 15:16 МСК🤖 Auto

NVIDIA Nemotron-Labs-3-Puzzle-75B: Сжатие MoE для 2x пропускной способности

NVIDIA представила сжатую гибридную MoE-модель Nemotron-Labs-3-Puzzle-75B-A9B, которая обеспечивает рост серверной пропускной способности до 2.14x при сохранении качества на уровне родителя Nemotron-3-Super.

Баннер новости 3204

Суть прорыва: Архитектурная оптимизация без потери логики

NVIDIA AI Team выпустила Nemotron-Labs-3-Puzzle-75B-A9B — сжатый вариант гибридной модели Mamba-Transformer MoE. В отличие от простого уменьшения размеров, команда сохранила исходную структуру из 88 блоков (40 Mamba, 40 MoE, 8 attention), изменив только внутреннюю емкость слоев. Это позволило снизить количество активных параметров с 12.8B до 9.3B, что критически важно для ограничения потребления памяти и ускорения инференса.

Сравнение архитектуры: Super vs Puzzle

Модель-родитель Nemotron-3-Super имеет 120.7B параметров, тогда как новая версия — 75.3B. Ключевые изменения затронули размер состояния Mamba (SSM) и емкость экспертов MoE. Attention-слои остались нетронутыми, так как они уже эффективны по KV-cache.

Параметр Nemotron-3-Super Puzzle-75B-A9B Изменение
Всего параметров 120.7B 75.3B -37.6%
Активных параметров 12.8B 9.3B -27.3%
Размер состояния Mamba (SSM) 128 96 -25%
Средний размер эксперта MoE 2688 1280-2688 -40.1%
Активированных экспертов на токен 22 4-18 -50%

Производительность: До 2.14x при matched user throughput

Тестирование проводилось на узле 8xB200 с использованием весов NVFP4. Главная метрика — серверная пропускная способность (server throughput) при фиксированной скорости для пользователя (user throughput). Наибольший выигрыш наблюдается в сценариях с длинным контекстом (decode-heavy), где память становится узким местом.

Сценарий (In/Out) UT floor Super (tok/s) Puzzle-75B-A9B (tok/s) Ускорение
50K / 2K >= 100 5,128 8,210 1.60x
8K / 64K >= 100 20,939 42,601 2.03x
8K / 64K >= 125 13,074 27,918 2.14x

Решение проблемы памяти: 8 запросов на одной H100

Самый впечатляющий результат достигнут на одной видеокарте NVIDIA H100 при работе с контекстом в 1M токенов. Из-за ограничений HBM (80 GB) модель Super могла обслуживать только 1 такой запрос (70 GB под веса + 4 GB под KV-cache). Новая модель Puzzle занимает всего 44.5 GB под веса, что позволяет одновременно обрабатывать 8 запросов с контекстом 1M токенов. Это дает ~4x рост агрегатной пропускной способности декодирования по сравнению с одиночным запросом Super.

Методология: Iterative Puzzle и восстановление качества

Сжатие выполнено через фреймворк Puzzletron (Iterative Neural Architecture Search). Процесс включает три этапа сжатия с промежуточной дистилляцией знаний (Knowledge Distillation) от Nemotron-3-Nano. Итеративный подход превзошел одношаговое сжатие на 0.57 балла в среднем по бенчмаркам. Несмотря на сжатие, модель сохраняет высокую точность: Arena-Hard-V2 упал всего на 4.2 балла, а SWE-Bench — на 2.6 балла относительно родителя.

Бенчмарки

БенчмаркNemotron-Labs-3-Puzzle-75B-A9B (IterativNemotron-Labs-3-Puzzle-75B-A9B (Single-s
Average (10 benchmarks)69.05points68.48points

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗