Энергия как главный лимит AI-индустрии
В эпоху агентного ИИ (Agentic AI) спрос на токены растет экспоненциально, но физическое ограничение остается неизменным — доступная мощность. NVIDIA заявляет, что производительность на ватт (performance per watt) становится единственным честным метриком, определяющим прибыльность AI-фабрик. Именно этот показатель, а не просто пиковая скорость, определяет, кто сможет масштабироваться, а кто нет.
Цифры эффективности: Blackwell против Hopper
Архитектура Mixture-of-Experts (MoE) требует сложного ко-дизайна всего стека. Платформа NVIDIA Blackwell (GB300 NVL72) демонстрирует колоссальный разрыв с предыдущим поколением Hopper. Согласно данным SemiAnalysis InferenceX, прирост эффективности варьируется в зависимости от модели:
| Модель | Прирост производительности на ватт (GB300 vs Hopper) | Примечание |
|---|---|---|
| DeepSeek V4 Pro | до 25x | Лидер по эффективности |
| GLM5.1 | до 20x | — |
| Kimi K2.6 | до 10x | Оптимизирована для долгосрочных агентов |
Важно отметить, что эти цифры — стартовая точка. Благодаря постоянным обновлениям ПО, производительность на DeepSeek V4 выросла еще в 5 раз всего за один месяц после внедрения.
Ко-дизайн: от NVLink до софта
Результат достигнут не только за счет кремния, но и через глубокую интеграцию компонентов:
- NVLink Switch 6-го поколения: Создан специально для AI, поддерживает вычисления в сети (SHARP), разгружая GPU.
- Софтверный стек: Dynamo, TensorRT LLM, SGLang и vLLM позволяют использовать NVFP4-квантование, отладку KV-кэша и параллелизм экспертов.
- DSX MaxLPS: Программное обеспечение управления питанием позволяет перераспределять энергию в реальном времени, поддерживая жидкостное охлаждение. Это дает возможность запустить на 40% больше GPU в рамках того же бюджета мощности.
Реальные кейсы: Anthropic, OpenAI и CoreWeave
Теория подтверждена практикой. Ведущие лаборатории уже используют Blackwell NVL72 для инференса:
- Anthropic и OpenAI используют платформу для работы с frontier-моделями.
- CoreWeave развернул Kimi K2.6, комбинируя NVFP4 и EAGLE3-декодирование.
- Perplexity обрабатывает миллионы запросов ежедневно на Qwen3 235B/397B-A17B.
- Fireworks AI использует платформу для GLM 5.2, обслуживая клиентов вроде Cursor.
Взгляд в будущее: Vera Rubin
Опыт эксплуатации Blackwell в продакшене закладывает фундамент для следующей платформы — NVIDIA Vera Rubin. Она наследует rack-scale эффективность и продолжает повышать энергоэффективность, что критически важно для экономики AI-индустрии в ближайшие годы.
Источник: NVIDIA Blog ↗
