Проблема: от кремния до первого токена
Цепочка поставок NVIDIA — одна из самых сложных в мире. Платформа Grace Blackwell NVL72 требует миллионов деталей от тысяч поставщиков. Один вычислительный трей (один из 18 в стойке) включает 2 CPU Grace, 4 GPU Blackwell и 32 стека HBM3e. Ключевая метрика — Time of Ownership (TOO): время от получения материала заводом до отгрузки готового узла. Задача — минимизировать TOO, распределяя ограниченные ресурсы между фабриками.
Решение: cuOpt и Palantir Foundry
Команда создала «Цифровой командный центр» на базе Palantir Foundry. Он объединяет структурированные данные (материалы, мощности) и неструктурированные сигналы (почты, прогнозы погоды, геополитика) в единый слой Ontology. Оптимизация распределения материалов решается через NVIDIA cuOpt — библиотеку для GPU-ускоренного решения смешанных целочисленных линейных программ (MILP). cuOpt не только выдает план, но и указывает «узкие места» (binding constraints), например, дефицит памяти или пропускной способности в Тайване.
Где математика бессильна: роль человека
Бэктесты показали, что люди-планировщики превосходят количественные модели. Они учитывают контекст, недоступный для оптимизатора: переписку с партнерами, погодные прогнозы, геополитические события и результаты встреч с поставщиками. Чтобы кодифицировать этот экспертный опыт, NVIDIA использовала Nemotron 3.5 Lightning.
Результаты: Nemotron 3.5 Lightning
Модель была дообучена (post-trained) на захваченных решениях, обоснованиях и результатах планировщиков с использованием инструментов NeMo Anonymizer, Data Designer и AutoModel в рамках управляемого цикла Palantir Autopilot. Специализированная модель с 30 миллиардами параметров показала выдающиеся результаты:
| Модель | Точность принятия решений (%) | Примечание |
|---|---|---|
| Nemotron 3.5 Lightning (30B) | 86.7% | Специализированная модель, лидер бенчмарка |
| Nemotron 3 Ultra | 55.5% | Уступает Lightning на 31.2 п.п. |
| Базовая модель Nemotron | 17.5% | Уступает Lightning на 69.2 п.п. |
Значение для индустрии
Принятые, отредактированные и отклоненные рекомендации модели автоматически возвращаются в Ontology Palantir. Это создает «AI-муху» (AI flywheel): система накапливает институциональные знания, сокращает время онбординга новых планировщиков и постоянно улучшает свои рекомендации. NVIDIA рекомендует исследовать Nemotron LoRA customization cookbook для адаптации открытых моделей под агентные рабочие процессы.
Источник: NVIDIA dev blog ↗
