Инструменты30 июня 2026 г., 22:25 МСК🤖 Auto

NVIDIA Blackwell: снижение стоимости токена в 5 раз за месяц

Программный стек NVIDIA для инференса на архитектуре Blackwell позволил сократить стоимость генерации токенов модели DeepSeek V4 в 5 раз всего за один месяц благодаря оптимизациям vLLM и SGLang.

Баннер новости 2598

От пиковых характеристик к экономике токена

По мере перехода компаний от пилотных проектов к промышленным AI-фабрикам, фокус сместился с пиковых спецификаций чипов на стоимость за токен (cost per token). Ключевыми метриками стали количество полезных токенов, доставленных за доллар и ватт, при соблюдении требований к задержкам. Программный стек NVIDIA, созданный в ко-дизайне с GPU, CPU и сетевыми решениями, демонстрирует, как софт может многократно усиливать железо.

Результаты на платформе Blackwell

На платформе NVIDIA Blackwell программный стек уже обеспечил снижение стоимости токена модели DeepSeek V4 в 5 раз всего за один месяц. Это стало возможным благодаря совместной работе с экосистемой open source. Лидеры рынка, такие как Baseten, Cognition, Deep Infra и Together AI, уже используют эти оптимизации для обслуживания моделей уровня frontier.

Ключевые достижения оптимизаций:

  • Baseten: Использование TensorRT-LLM для DeepSeek V4 Pro дало прирост до 50% токенов в секунду за счет проприетарных runtime-оптимизаций.
  • Together AI: Ускорение вывода моделей для Cursor с помощью TensorRT-LLM.
  • Deep Infra: Развертывание frontier-моделей на Blackwell с первого дня (day-zero).

Компounding-эффект оптимизаций

Сложность агентных AI-систем (Agentic AI), требующих распределенных вычислений, памяти и инструментов, делает критически важным системный подход. NVIDIA объединяет три слоя:

  1. Production Operation: Оркестрация, автоскейлинг и управление памятью.
  2. Application Acceleration: Runtime-оптимизации, слияние ядер (kernel fusion) и перекрытие вычислений с коммуникациями.
  3. Infrastructure Access: Прямой доступ к возможностям GPU и сети без низкоуровневой настройки.

Сочетание таких техник, как дисагрегированный инференс, крупное экспертное параллелизм (Large EP) через NVLink, точность NVFP4 и многозадачное предсказание токенов (MTP), увеличивает пропускную способность до 20x по сравнению с базовым уровнем.

Роль Open Source и PyTorch

Открытая экосистема, построенная на CUDA, ускоряет внедрение инноваций. Фреймворки vLLM и SGLang обеспечивают поддержку новых моделей (например, DeepSeek V4) с первого дня выпуска. Именно благодаря этому стеку производительность на Blackwell выросла в 5 раз за месяц, снизив стоимость токена до ~20% от предыдущих уровней. Интеграция с PyTorch позволяет мгновенно применять прорывы, такие как DFlash (до 15x прироста пропускной способности) и FastVideo (генерация 1080p видео менее чем за 5 секунд).

Технология / Оптимизация Эффект / Метрика Применение
DeepSeek V4 на Blackwell (vLLM/SGLang) Снижение стоимости токена в 5 раз за 1 месяц Frontier open source модели
Комбинация оптимизаций (Disaggregated serving, Large EP, NVFP4, MTP) Увеличение пропускной способности до 20x Системный уровень производительности
Baseten (TensorRT-LLM) +50% токенов в секунду DeepSeek V4 Pro (reasoning, coding)
DFlash (speculative decode) До 15x больше пропускной способности Существующее железо, PyTorch
FastVideo Генерация 1080p видео < 5 секунд Видео-генерация

Источник: NVIDIA Blog ↗