От пиковых характеристик к экономике токена
По мере перехода компаний от пилотных проектов к промышленным AI-фабрикам, фокус сместился с пиковых спецификаций чипов на стоимость за токен (cost per token). Ключевыми метриками стали количество полезных токенов, доставленных за доллар и ватт, при соблюдении требований к задержкам. Программный стек NVIDIA, созданный в ко-дизайне с GPU, CPU и сетевыми решениями, демонстрирует, как софт может многократно усиливать железо.
Результаты на платформе Blackwell
На платформе NVIDIA Blackwell программный стек уже обеспечил снижение стоимости токена модели DeepSeek V4 в 5 раз всего за один месяц. Это стало возможным благодаря совместной работе с экосистемой open source. Лидеры рынка, такие как Baseten, Cognition, Deep Infra и Together AI, уже используют эти оптимизации для обслуживания моделей уровня frontier.
Ключевые достижения оптимизаций:
- Baseten: Использование TensorRT-LLM для DeepSeek V4 Pro дало прирост до 50% токенов в секунду за счет проприетарных runtime-оптимизаций.
- Together AI: Ускорение вывода моделей для Cursor с помощью TensorRT-LLM.
- Deep Infra: Развертывание frontier-моделей на Blackwell с первого дня (day-zero).
Компounding-эффект оптимизаций
Сложность агентных AI-систем (Agentic AI), требующих распределенных вычислений, памяти и инструментов, делает критически важным системный подход. NVIDIA объединяет три слоя:
- Production Operation: Оркестрация, автоскейлинг и управление памятью.
- Application Acceleration: Runtime-оптимизации, слияние ядер (kernel fusion) и перекрытие вычислений с коммуникациями.
- Infrastructure Access: Прямой доступ к возможностям GPU и сети без низкоуровневой настройки.
Сочетание таких техник, как дисагрегированный инференс, крупное экспертное параллелизм (Large EP) через NVLink, точность NVFP4 и многозадачное предсказание токенов (MTP), увеличивает пропускную способность до 20x по сравнению с базовым уровнем.
Роль Open Source и PyTorch
Открытая экосистема, построенная на CUDA, ускоряет внедрение инноваций. Фреймворки vLLM и SGLang обеспечивают поддержку новых моделей (например, DeepSeek V4) с первого дня выпуска. Именно благодаря этому стеку производительность на Blackwell выросла в 5 раз за месяц, снизив стоимость токена до ~20% от предыдущих уровней. Интеграция с PyTorch позволяет мгновенно применять прорывы, такие как DFlash (до 15x прироста пропускной способности) и FastVideo (генерация 1080p видео менее чем за 5 секунд).
| Технология / Оптимизация | Эффект / Метрика | Применение |
|---|---|---|
| DeepSeek V4 на Blackwell (vLLM/SGLang) | Снижение стоимости токена в 5 раз за 1 месяц | Frontier open source модели |
| Комбинация оптимизаций (Disaggregated serving, Large EP, NVFP4, MTP) | Увеличение пропускной способности до 20x | Системный уровень производительности |
| Baseten (TensorRT-LLM) | +50% токенов в секунду | DeepSeek V4 Pro (reasoning, coding) |
| DFlash (speculative decode) | До 15x больше пропускной способности | Существующее железо, PyTorch |
| FastVideo | Генерация 1080p видео < 5 секунд | Видео-генерация |
Источник: NVIDIA Blog ↗
