Суть прорыва: Архитектурная оптимизация без потери логики
NVIDIA AI Team выпустила Nemotron-Labs-3-Puzzle-75B-A9B — сжатый вариант гибридной модели Mamba-Transformer MoE. В отличие от простого уменьшения размеров, команда сохранила исходную структуру из 88 блоков (40 Mamba, 40 MoE, 8 attention), изменив только внутреннюю емкость слоев. Это позволило снизить количество активных параметров с 12.8B до 9.3B, что критически важно для ограничения потребления памяти и ускорения инференса.
Сравнение архитектуры: Super vs Puzzle
Модель-родитель Nemotron-3-Super имеет 120.7B параметров, тогда как новая версия — 75.3B. Ключевые изменения затронули размер состояния Mamba (SSM) и емкость экспертов MoE. Attention-слои остались нетронутыми, так как они уже эффективны по KV-cache.
| Параметр | Nemotron-3-Super | Puzzle-75B-A9B | Изменение |
|---|---|---|---|
| Всего параметров | 120.7B | 75.3B | -37.6% |
| Активных параметров | 12.8B | 9.3B | -27.3% |
| Размер состояния Mamba (SSM) | 128 | 96 | -25% |
| Средний размер эксперта MoE | 2688 | 1280-2688 | -40.1% |
| Активированных экспертов на токен | 22 | 4-18 | -50% |
Производительность: До 2.14x при matched user throughput
Тестирование проводилось на узле 8xB200 с использованием весов NVFP4. Главная метрика — серверная пропускная способность (server throughput) при фиксированной скорости для пользователя (user throughput). Наибольший выигрыш наблюдается в сценариях с длинным контекстом (decode-heavy), где память становится узким местом.
| Сценарий (In/Out) | UT floor | Super (tok/s) | Puzzle-75B-A9B (tok/s) | Ускорение |
|---|---|---|---|---|
| 50K / 2K | >= 100 | 5,128 | 8,210 | 1.60x |
| 8K / 64K | >= 100 | 20,939 | 42,601 | 2.03x |
| 8K / 64K | >= 125 | 13,074 | 27,918 | 2.14x |
Решение проблемы памяти: 8 запросов на одной H100
Самый впечатляющий результат достигнут на одной видеокарте NVIDIA H100 при работе с контекстом в 1M токенов. Из-за ограничений HBM (80 GB) модель Super могла обслуживать только 1 такой запрос (70 GB под веса + 4 GB под KV-cache). Новая модель Puzzle занимает всего 44.5 GB под веса, что позволяет одновременно обрабатывать 8 запросов с контекстом 1M токенов. Это дает ~4x рост агрегатной пропускной способности декодирования по сравнению с одиночным запросом Super.
Методология: Iterative Puzzle и восстановление качества
Сжатие выполнено через фреймворк Puzzletron (Iterative Neural Architecture Search). Процесс включает три этапа сжатия с промежуточной дистилляцией знаний (Knowledge Distillation) от Nemotron-3-Nano. Итеративный подход превзошел одношаговое сжатие на 0.57 балла в среднем по бенчмаркам. Несмотря на сжатие, модель сохраняет высокую точность: Arena-Hard-V2 упал всего на 4.2 балла, а SWE-Bench — на 2.6 балла относительно родителя.
Бенчмарки
| Бенчмарк | Nemotron-Labs-3-Puzzle-75B-A9B (Iterativ | Nemotron-Labs-3-Puzzle-75B-A9B (Single-s |
|---|---|---|
| Average (10 benchmarks) | 69.05points | 68.48points |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
