Реальные нагрузки OpenAI в Engineering SuperLab
Nvidia пригласила журналистов в свой Engineering SuperLab, чтобы показать не просто макеты, а полноценные стойки Vera Rubin NVL72, работающие под реальными нагрузками. Оказалось, что эти системы уже обрабатывают задачи для OpenAI, в частности, модель GPT-Rosalind. Это первый случай, когда архитектуру можно увидеть в действии, а не только на слайдах презентаций.
Каждая стойка NVL72 состоит из 18 вычислительных модулей и 9 коммутационных блоков NVLink. Внутри находится 72 GPU Rubin и 36 CPU Vera. Связь между чипами обеспечивается шестым поколением NVLink с пропускной способностью до 3.6 ТБ/с на GPU и общей масштабируемостью до 260 ТБ/с на стойку.
Полностью жидкостное охлаждение и скорость развертывания
В отличие от предыдущих поколений (GB200/GB300), стойки Vera Rubin используют исключительно жидкостное охлаждение без вентиляторов. Nvidia заявляет о технологии «сухого охлаждения» (dry cooling): при температуре входящего теплоносителя до 45°C система обходится без традиционных чиллеров, что экономит энергию, воду и пространство.
Процесс развертывания стандартизирован через Open Compute Project (OCP). От момента прибытия грузовика до включения стойки проходит всего 47 минут. Внутренняя структура включает NVLink-спайн с 5000 медных кабелей общей длиной более двух миль.
Революция в питании: 800VDC
Ключевой инновацией стала демонстрация системы питания 800VDC. Традиционные стойки потребляют более 200 кВт, что требует огромных токов при низком напряжении (48V/54V), приводя к потерям на преобразование и необходимости в массивных шинах. Переход на 800VDC позволяет повысить напряжение, сохраняя ток постоянным, что снижает потери при преобразовании AC/DC и уплотняет вычислительную плотность.
Технические характеристики Vera Rubin NVL72
| Параметр | Значение / Описание |
|---|---|
| Конфигурация | 72 GPU Rubin, 36 CPU Vera |
| Пропускная способность NVLink | 3.6 ТБ/с на GPU, 260 ТБ/с на стойку |
| Потребляемая мощность | Более 200 кВт на стойку |
| Система питания | 800VDC (демонстрация sidecar-модуля) |
| Охлаждение | Полностью жидкостное, без вентиляторов |
| Время развертывания | 47 минут (от разгрузки до включения) |
| Запускаемые задачи | OpenAI (GPT-Rosalind) |
Почему это важно
Демонстрация Vera Rubin NVL72 подтверждает, что Nvidia переходит от этапа проектирования к массовому внедрению инфраструктуры для агентного И. Внедрение 800VDC и отказ от чиллеров критически важны для масштабируемости: без этих решений рост энергопотребления ИИ-центров стал бы экономически и физически невозможным. OpenAI уже использует эту платформу, что сигнализирует о готовности индустрии к следующему этапу развития больших моделей.
Источник: Tom's Hardware ↗
