Проблема: GPU простаивает, ожидая CPU
В эпоху агентов ИИ (Agentic AI) процессор становится критическим узким местом. ИИ-агент работает в цикле: модель рассуждает → CPU выполняет инструменты/код → результат возвращается → модель решает дальше. Традиционные серверные CPU эволюционировали в сторону увеличения количества ядер для снижения стоимости аренды, жертвуя скоростью одного ядра. Это создает «налог на чиплеты» и задержки памяти, из-за чего GPU простаивает в ожидании завершения задач CPU, что напрямую снижает доходность AI-фабрик.
Решение: NVIDIA Vera и архитектура Olympus
NVIDIA Vera — это CPU нового класса, спроектированный с нуля для максимизации однопоточной производительности (max single-threaded performance). В основе лежит кастомное ядро Olympus, которое обеспечивает прирост IPC (инструкций за такт) на 50% по сравнению с предыдущим поколением NVIDIA Grace. Ключевые технические характеристики:
- 88 ядер на монолитном кристалле (monolithic compute die), что исключает задержки, присущие чиплетным архитектурам.
- Пропускная способность памяти: до 1.2 ТБ/с LPDDR5X при энергопотреблении менее 40 Вт.
- Взаимодействие ядер: 3.4 ТБ/с пропускной способности между ядрами (в 3 раза больше, чем у любых других серверных CPU).
Результаты бенчмарков и внедрение
В нагрузках, имитирующих работу агентов ИИ, Vera демонстрирует 1.8x устойчивую производительность на ядро по сравнению с x86-архитектурами. Партнеры NVIDIA уже тестируют чип в реальных сценариях:
| Партнер / Сценарий | Задача | Результат (по сравнению с x86) |
|---|---|---|
| Perplexity | Клонирование репозитория и запуск тестов в песочницах | Завершение задачи быстрее в 1.5x; запуск параллельных песочниц быстрее в 1.9x |
| Starburst | Аналитика больших данных (SQL) | Скорость выполнения выше в 3x |
| Redpanda | Потоковая передача данных в реальном времени | Задержка снижена в 6 раз |
Стратегия: Единая архитектура для всей AI-фабрики
Важно, что Vera использует ту же архитектуру, что и GPU в системе NVIDIA Vera Rubin, а также процессоры хранения BlueField-4 STX. Это позволяет унифицировать стек разработки и оптимизации. В качестве следующего шага NVIDIA анонсировала процессор Rosa с новым ядром Rigel (Arm v9.2), которое сохранит тот же размер кристалла, но улучшит доставку инструкций, увеличит кэш L2 и повысит эффективность работы с памятью.
Источник: NVIDIA Blog ↗
