Архитектура и ключевые характеристики
В июле 2026 года NVIDIA анонсировала процессорную архитектуру Vera, спроектированную специально для работы в связке с GPU в инфраструктуре AI Factory. В отличие от традиционных x86-решений, Vera использует монолитный вычислительный кристалл (monolithic compute die) с 88 ядрами Olympus, единым кэшем и технологией Scalable Coherency Fabric (SCF). Это решение направлено на устранение узких мест при выполнении последовательных задач агентов, таких как вызовы инструментов, выполнение кода и управление контекстом.
Производительность в Reinforcement Learning (RL)
Ключевой метрикой для RL-тренировок стала устойчивая производительность на одно ядро под полной нагрузкой. Благодаря оптимизированным ядрам Olympus, Vera CPU обеспечивает рост скорости на 1.8x по сравнению с базовыми процессорами. Это позволяет завершать до 85% симуляций среды за тот же промежуток времени, когда традиционные CPU справляются лишь с 45%. Более быстрая генерация данных обратной связи приводит к более качественным градиентам и ускоренной сходимости моделей.
Снижение задержек и пропускная способность памяти
Для интерактивных агентов критически важна предсказуемая задержка. Монолитная архитектура и SCF позволили снизить пиковую загрузочную задержку (peak loaded latency) на 40%. Кроме того, использование энергоэффективной памяти LPDDR5x обеспечивает пропускную способность до 1.2 ТБ/с (до 14 ГБ/с на ядро), что более чем в 3 раза превышает показатели традиционных серверных CPU при потреблении энергии менее чем в два раза ниже.
Сравнительные характеристики Vera CPU
| Параметр | NVIDIA Vera CPU | Традиционные x86 Data Center CPU |
|---|---|---|
| Архитектура кристалла | Монолитный (88 ядер Olympus) | Чиплетная (multi-chiplet) |
| Рост sustained per-core performance | +80% (1.8x) | База (1.0x) |
| Снижение пиковой задержки | -40% | База |
| Пропускная способность памяти на ядро | До 14 ГБ/с (LPDDR5x) | Базовый уровень |
| Энергоэффективность памяти | Более чем в 2 раза эффективнее | Стандартная |
Влияние на GPU-утилизацию
Ускорение CPU-части напрямую влияет на эффективность GPU. В агентных сценариях GPU простаивает во время выполнения CPU-задач (tool calls, retrieval). Уменьшение CPU-side stalls и сокращение времени реконструкции контекста (KV-cache evictions) позволяют GPU оставаться загруженным, повышая общую пропускную способность AI-фабрики и соблюдение SLA.
Источник: NVIDIA dev blog ↗
