Релиз модели17 августа 2026 г., 21:17 МСК🤖 Auto

NVIDIA Nemotron 3.5 Lightning: NVFP4 квантование с QAD

NVIDIA представила модель Nemotron 3.5 Lightning с квантованием NVFP4, достигнув 4x прироста скорости и сокращения размера с 66 до 22 ГБ благодаря методу QAD.

Баннер новости 5940

Прорыв в эффективности: Nemotron 3.5 Lightning NVFP4

Команда NVIDIA представила новую версию модели Nemotron 3.5 Lightning с форматом квантования NVFP4. Это решение позволяет сократить размер модели с 66 ГБ (BF16) до 22 ГБ, обеспечивая при этом до 4-кратного увеличения пропускной способности (throughput) без существенной потери точности. Ключевым достижением стало применение конвейера Quantization-Aware Distillation (QAD) через NVIDIA Model Optimizer, что делает модель идеальной для развертывания в условиях ограниченных ресурсов.

Методология: От PTQ к QAD

Процесс создания модели состоит из двух этапов. Сначала применяется постобучающее квантование (PTQ) для создания «студента» с весами W4A16. Затем, на этапе QAD, модель обучается на основе «учителя» (оригинальной BF16 модели) с использованием функции потерь KL-divergence. Это позволяет компенсировать шум квантования и восстановить точность, которую невозможно достичь только методом PTQ.

Сравнение подходов: PTQ против QAD

Эксперименты показали, что QAD стабильно превосходит стандартное PTQ по медианной восстановленной точности и результатам в агентных и кодинговых бенчмарках. Ниже приведены ключевые различия в настройках и результатах:

Параметр PTQ (Post-Training Quantization) QAD (Quantization-Aware Distillation)
Целевая точность после квантования > 99% медианной восстановления 95–99% медианной восстановления
Агрессивность квантования Консервативная (например, FP8 для Mamba) Агрессивная (W4A16 для Mamba, NVFP4 для KV)
Размер модели (Lightning) 66 ГБ (BF16 baseline) 22 ГБ (NVFP4)
Прирост пропускной способности Базовый До 4x
Инструментарий Стандартное квантование NVIDIA Model Optimizer + Megatron-Bridge

Технические детали реализации

Для достижения максимальных результатов команда NVIDIA использовала рецепт four_over_six с квантованием KV-кэша в NVFP4 (W4A4), оставляя операции QK^T и attn·V в BF16. Калибровка проводилась на 1000 образцах с длиной последовательности 32K на одной системе NVIDIA DGX B300. Базовой моделью-учителем выступала NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16. Такой подход позволяет разработчикам использовать более агрессивные настройки квантования, которые при чистом PTQ привели бы к неприемлемой деградации качества.

Источник: NVIDIA dev blog ↗