Релиз модели14 сентября 2026 г., 13:46 МСК🤖 Auto

NVIDIA выпустила DeepSeek-V4-Pro с NVFP4 и DSpark: 1.65T параметров на Blackwell

NVIDIA представила квантованную версию модели DeepSeek-V4-Pro с поддержкой специкулятивного декодирования DSpark. Модель оптимизирована для NVIDIA Blackwell и достигает высокой скорости генерации при сохранении точности.

Баннер новости 7445

Суть обновления: Единый чекпоинт NVFP4

NVIDIA выпустила на Hugging Face модель DeepSeek-V4-Pro-0813-nvfp4-DSpark. Это не новая архитектура, а оптимизированная версия оригинальной модели DeepSeek-V4-Pro. Ключевое отличие от предыдущей квантованной версии (nvidia/DeepSeek-V4-Pro-0813-NVFP4) заключается в том, что теперь все веса, включая заголовки DSpark (draft head), приведены к формату NVFP4. Ранее заголовки оставались в формате MXFP4, что создавало несовместимость. Теперь чекпоинт самосогласован: и целевая, и черновая модели используют один формат квантования, что упрощает развертывание.

Архитектура и ресурсы

Модель является авторегрессионной смесью экспертов (MoE) с гибридным вниманием. Она использует 1.65 триллиона параметров, из которых активными являются только 49 миллиардов. Архитектура включает Compressed Sparse Attention и Manifold-Constrained Hyper-Connections. Модель поддерживает контекстное окно до 1 миллиона токенов и работает с уровнями усилий рассуждения (low, high, max).

Производительность и бенчмарки

Оптимизация проводилась на базе NVIDIA Model Optimizer (v0.47.0rc1). Тестирование проводилось на GPU NVIDIA Blackwell B200 (для точности) и B300 (для специкулятивного декодирования). Модель использует движки SGLang и vLLM. Ниже приведены ключевые метрики эффективности специкулятивного декодирования DSpark, которое позволяет возвращать несколько токенов за один шаг генерации:

Метрика / Тест Значение / Описание
Общее число параметров 1.65T (активные: 49B)
Формат квантования NVFP4 (бит-идентично оригиналу, 100% блоков без потерь)
Hardware (Точность) NVIDIA Blackwell B200
Hardware (Speculative) NVIDIA Blackwell B300
Средняя длина принятия (Acceptance Length) Увеличена за счет DSpark (конкретные цифры см. в репозитории DeepSpec)
Бенчмарки GPQA Diamond, MT-Bench, SPEED-Bench, Terminal-Bench Hard

Для чего подходит модель

DeepSeek-V4-Pro позиционируется для сложных задач: агентный ИИ, использование инструментов (tool use), математическое моделирование, программирование и корпоративные ассистенты. Модель поддерживает структурированный вывод JSON и многооборотные диалоги с системными промптами. Лицензия — MIT, что разрешает коммерческое использование.

Технические детали развертывания

Модель готова к запуску через vLLM в режиме DSpark. Алгоритм DSpark использует легковесную Марковскую голову для внедрения зависимости между токенами и голову уверенности для предсказания вероятности принятия. Это позволяет увеличить длину принятых последовательностей по сравнению с чисто параллельными драфтерами. Калибровка проводилась на датасетах CNN/DailyMail и Nemotron-Post-Training-Dataset-v2.

Источник: Huggingface ↗