Релиз модели1 июля 2026 г., 11:16 МСК🤖 Auto

NVIDIA Nemotron-Labs-TwoTower: Диффузия в 2.42x быстрее AR с потерей качества 1.3%

NVIDIA выпустила Nemotron-Labs-TwoTower — гибридную языковую модель, объединяющую авторегрессию и диффузию. Архитектура обеспечивает рост пропускной способности генерации в 2.42 раза при сохранении 98.7% качества базовой модели.

Баннер новости 2717

Архитектурный прорыв: разделение задач

Ключевая проблема авторегрессионных (AR) моделей — последовательная генерация токенов, создающая узкое горлышко в пропускной способности. NVIDIA решает это через архитектуру TwoTower, которая разделяет процесс на два независимых блока:

  • Контекстная башня (AR): Замороженная часть на базе Nemotron-3-Nano-30B-A3B. Она обрабатывает промпт и сгенерированные токены, сохраняя KV-cache и состояния Mamba-2.
  • Денойзер-башня (Diffusion): Обученная часть, которая параллельно уточняет блоки токенов (block-wise diffusion). Она использует кросс-аттенцию к слоям контекстной башни для доступа к многоуровневым репрезентациям.

Модель содержит около 60 млрд параметров, из которых активными являются ~3 млрд на токен. Денойзер обучался на ~2.1 трлн токенов, в то время как базовая AR-модель была обучена на 25 трлн.

Результаты бенчмарков: скорость против точности

Тестирование проводилось на двух GPU NVIDIA H100 в формате BF16. По умолчанию используется порог уверенности γ=0.8 и размер блока S=16. Модель сохраняет качество общего знания, но демонстрирует умеренное снижение в задачах программирования и математики.

Задача Nemotron-3-Nano (AR) TwoTower (Diffusion) Изменение
MMLU (acc) 78.56 78.24 -0.32
ARC-Challenge (acc_norm) 91.72 92.66 +0.94
HumanEval (pass@1) 79.27 75.58 -3.69
GSM8K (acc) 92.49 90.14 -2.35
MATH-500 (acc) 84.40 80.60 -3.80
Общее качество 100% 98.7% -1.3%
Пропускная способность 1.0× 2.42× +142%

Практическое применение и требования

Модель поддерживает три режима инференса через один чекпоинт:

  1. Full Two-Tower Diffusion: Требует 2 GPU (H100 80GB), занимает ~59GB VRAM на карту. Максимальная скорость.
  2. Mock-AR / AR: Работает на одном GPU 80GB. Используется для верификации или специкулятивного декодирования.

Это решение идеально подходит для генерации синтетических данных, где критична скорость, а не идеальная точность кода. Пользователи могут настраивать компромисс, изменяя параметр γ: снижение порога увеличивает скорость, но снижает качество.

Открытость и лицензия

Веса модели опубликованы под NVIDIA Nemotron Open Model License, что разрешает коммерческое использование. Это первый шаг NVIDIA к популяризации диффузионных языковых моделей, предлагающий альтернативу традиционным AR-архитектурам для высоконагруженных сценариев.

Бенчмарки

БенчмаркNemotron-Labs-TwoTower (diffusion)Nemotron-3-Nano-30B-A3B (AR)
MMLU78.24%78.56%
MMLU-Pro60.93%62.59%
ARC-Challenge92.66%91.72%
HumanEval75.58%79.27%
GSM8K90.14%92.49%
MATH-50080.6%84.4%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: MarkTechPost ↗