Суть обновления: Единый чекпоинт NVFP4
NVIDIA выпустила на Hugging Face модель DeepSeek-V4-Pro-0813-nvfp4-DSpark. Это не новая архитектура, а оптимизированная версия оригинальной модели DeepSeek-V4-Pro. Ключевое отличие от предыдущей квантованной версии (nvidia/DeepSeek-V4-Pro-0813-NVFP4) заключается в том, что теперь все веса, включая заголовки DSpark (draft head), приведены к формату NVFP4. Ранее заголовки оставались в формате MXFP4, что создавало несовместимость. Теперь чекпоинт самосогласован: и целевая, и черновая модели используют один формат квантования, что упрощает развертывание.
Архитектура и ресурсы
Модель является авторегрессионной смесью экспертов (MoE) с гибридным вниманием. Она использует 1.65 триллиона параметров, из которых активными являются только 49 миллиардов. Архитектура включает Compressed Sparse Attention и Manifold-Constrained Hyper-Connections. Модель поддерживает контекстное окно до 1 миллиона токенов и работает с уровнями усилий рассуждения (low, high, max).
Производительность и бенчмарки
Оптимизация проводилась на базе NVIDIA Model Optimizer (v0.47.0rc1). Тестирование проводилось на GPU NVIDIA Blackwell B200 (для точности) и B300 (для специкулятивного декодирования). Модель использует движки SGLang и vLLM. Ниже приведены ключевые метрики эффективности специкулятивного декодирования DSpark, которое позволяет возвращать несколько токенов за один шаг генерации:
| Метрика / Тест | Значение / Описание |
|---|---|
| Общее число параметров | 1.65T (активные: 49B) |
| Формат квантования | NVFP4 (бит-идентично оригиналу, 100% блоков без потерь) |
| Hardware (Точность) | NVIDIA Blackwell B200 |
| Hardware (Speculative) | NVIDIA Blackwell B300 |
| Средняя длина принятия (Acceptance Length) | Увеличена за счет DSpark (конкретные цифры см. в репозитории DeepSpec) |
| Бенчмарки | GPQA Diamond, MT-Bench, SPEED-Bench, Terminal-Bench Hard |
Для чего подходит модель
DeepSeek-V4-Pro позиционируется для сложных задач: агентный ИИ, использование инструментов (tool use), математическое моделирование, программирование и корпоративные ассистенты. Модель поддерживает структурированный вывод JSON и многооборотные диалоги с системными промптами. Лицензия — MIT, что разрешает коммерческое использование.
Технические детали развертывания
Модель готова к запуску через vLLM в режиме DSpark. Алгоритм DSpark использует легковесную Марковскую голову для внедрения зависимости между токенами и голову уверенности для предсказания вероятности принятия. Это позволяет увеличить длину принятых последовательностей по сравнению с чисто параллельными драфтерами. Калибровка проводилась на датасетах CNN/DailyMail и Nemotron-Post-Training-Dataset-v2.
Источник: Huggingface ↗
