Прорыв в эффективности: Nemotron 3.5 Lightning NVFP4
Команда NVIDIA представила новую версию модели Nemotron 3.5 Lightning с форматом квантования NVFP4. Это решение позволяет сократить размер модели с 66 ГБ (BF16) до 22 ГБ, обеспечивая при этом до 4-кратного увеличения пропускной способности (throughput) без существенной потери точности. Ключевым достижением стало применение конвейера Quantization-Aware Distillation (QAD) через NVIDIA Model Optimizer, что делает модель идеальной для развертывания в условиях ограниченных ресурсов.
Методология: От PTQ к QAD
Процесс создания модели состоит из двух этапов. Сначала применяется постобучающее квантование (PTQ) для создания «студента» с весами W4A16. Затем, на этапе QAD, модель обучается на основе «учителя» (оригинальной BF16 модели) с использованием функции потерь KL-divergence. Это позволяет компенсировать шум квантования и восстановить точность, которую невозможно достичь только методом PTQ.
Сравнение подходов: PTQ против QAD
Эксперименты показали, что QAD стабильно превосходит стандартное PTQ по медианной восстановленной точности и результатам в агентных и кодинговых бенчмарках. Ниже приведены ключевые различия в настройках и результатах:
| Параметр | PTQ (Post-Training Quantization) | QAD (Quantization-Aware Distillation) |
|---|---|---|
| Целевая точность после квантования | > 99% медианной восстановления | 95–99% медианной восстановления |
| Агрессивность квантования | Консервативная (например, FP8 для Mamba) | Агрессивная (W4A16 для Mamba, NVFP4 для KV) |
| Размер модели (Lightning) | 66 ГБ (BF16 baseline) | 22 ГБ (NVFP4) |
| Прирост пропускной способности | Базовый | До 4x |
| Инструментарий | Стандартное квантование | NVIDIA Model Optimizer + Megatron-Bridge |
Технические детали реализации
Для достижения максимальных результатов команда NVIDIA использовала рецепт four_over_six с квантованием KV-кэша в NVFP4 (W4A4), оставляя операции QK^T и attn·V в BF16. Калибровка проводилась на 1000 образцах с длиной последовательности 32K на одной системе NVIDIA DGX B300. Базовой моделью-учителем выступала NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16. Такой подход позволяет разработчикам использовать более агрессивные настройки квантования, которые при чистом PTQ привели бы к неприемлемой деградации качества.
Источник: NVIDIA dev blog ↗
