Архитектурный прорыв: разделение задач
Ключевая проблема авторегрессионных (AR) моделей — последовательная генерация токенов, создающая узкое горлышко в пропускной способности. NVIDIA решает это через архитектуру TwoTower, которая разделяет процесс на два независимых блока:
- Контекстная башня (AR): Замороженная часть на базе Nemotron-3-Nano-30B-A3B. Она обрабатывает промпт и сгенерированные токены, сохраняя KV-cache и состояния Mamba-2.
- Денойзер-башня (Diffusion): Обученная часть, которая параллельно уточняет блоки токенов (block-wise diffusion). Она использует кросс-аттенцию к слоям контекстной башни для доступа к многоуровневым репрезентациям.
Модель содержит около 60 млрд параметров, из которых активными являются ~3 млрд на токен. Денойзер обучался на ~2.1 трлн токенов, в то время как базовая AR-модель была обучена на 25 трлн.
Результаты бенчмарков: скорость против точности
Тестирование проводилось на двух GPU NVIDIA H100 в формате BF16. По умолчанию используется порог уверенности γ=0.8 и размер блока S=16. Модель сохраняет качество общего знания, но демонстрирует умеренное снижение в задачах программирования и математики.
| Задача | Nemotron-3-Nano (AR) | TwoTower (Diffusion) | Изменение |
|---|---|---|---|
| MMLU (acc) | 78.56 | 78.24 | -0.32 |
| ARC-Challenge (acc_norm) | 91.72 | 92.66 | +0.94 |
| HumanEval (pass@1) | 79.27 | 75.58 | -3.69 |
| GSM8K (acc) | 92.49 | 90.14 | -2.35 |
| MATH-500 (acc) | 84.40 | 80.60 | -3.80 |
| Общее качество | 100% | 98.7% | -1.3% |
| Пропускная способность | 1.0× | 2.42× | +142% |
Практическое применение и требования
Модель поддерживает три режима инференса через один чекпоинт:
- Full Two-Tower Diffusion: Требует 2 GPU (H100 80GB), занимает ~59GB VRAM на карту. Максимальная скорость.
- Mock-AR / AR: Работает на одном GPU 80GB. Используется для верификации или специкулятивного декодирования.
Это решение идеально подходит для генерации синтетических данных, где критична скорость, а не идеальная точность кода. Пользователи могут настраивать компромисс, изменяя параметр γ: снижение порога увеличивает скорость, но снижает качество.
Открытость и лицензия
Веса модели опубликованы под NVIDIA Nemotron Open Model License, что разрешает коммерческое использование. Это первый шаг NVIDIA к популяризации диффузионных языковых моделей, предлагающий альтернативу традиционным AR-архитектурам для высоконагруженных сценариев.
Бенчмарки
| Бенчмарк | Nemotron-Labs-TwoTower (diffusion) | Nemotron-3-Nano-30B-A3B (AR) |
|---|---|---|
| MMLU | 78.24% | 78.56% |
| MMLU-Pro | 60.93% | 62.59% |
| ARC-Challenge | 92.66% | 91.72% |
| HumanEval | 75.58% | 79.27% |
| GSM8K | 90.14% | 92.49% |
| MATH-500 | 80.6% | 84.4% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: MarkTechPost ↗
