В эпоху, когда искусственный интеллект перестает быть просто генератором текста и превращается в автономных агентов, способных планировать, выполнять действия и взаимодействовать с внешним миром, архитектура вычислительных систем претерпевает фундаментальные изменения. Долгое время фокус индустрии был сосредоточен исключительно на графических процессорах (GPU), которые обеспечивали невероятную скорость обучения моделей и генерации токенов. Однако, как показывает практика современных Agentic AI-систем, именно центральный процессор (CPU) часто становится узким местом, определяющим общую эффективность всей «AI-фабрики».
Компания NVIDIA представила новую архитектуру Vera CPU, которая позиционируется не просто как фоновый компонент, а как ключевой драйвер производительности для агентных рабочих нагрузок. Эта система разработана специально для решения проблем, возникающих при масштабировании сложных многошаговых рабочих процессов, где CPU выполняет критически важную работу между этапами работы GPU: от выполнения инструментов (tool calls) до управления контекстом и кэшем.
В этой статье мы подробно разберем, как архитектура NVIDIA Vera, оснащенная 88 ядрами Olympus, решает три главные проблемы современных ИИ-систем: замедление обучения с подкреплением (RL), задержки при интерактивном обслуживании пользователей и неэффективное использование памяти GPU из-за вытеснения кэша. Мы рассмотрим технические детали, сравним показатели с традиционными x86-решениями и объясним, почему это изменение архитектуры важно для разработчиков и инженеров, работающих с агентным ИИ.
01Почему CPU стал критическим компонентом в эпоху Agentic AI?
Агентные системы ИИ кардинально отличаются от традиционных генеративных моделей. Если обычная LLM (Large Language Model) просто предсказывает следующий токен на основе промпта, то агент — это сложная система, которая превращает рассуждения модели в действия. Это происходит через многошаговые рабочие процессы, включающие инференс, использование инструментов (API, базы данных), выполнение кода, поиск информации (retrieval), оркестрацию задач и обработку результатов.
В такой архитектуре GPU не работает непрерывно. После каждого шага генерации текста или рассуждения система должна передать управление CPU. Именно процессор выполняет «грязную работу» между шагами модели: запускает песочницы для безопасной оценки кода, выполняет вызовы инструментов, обрабатывает данные, координирует работу KV-кэша (key-value cache) и управляет результатами. Если CPU работает медленно, вся цепочка тормозит, независимо от того, насколько мощным является GPU.
Ключевым показателем здесь становится не просто общая пропускная способность, а устойчивая производительность на одно ядро (sustained per-core performance) под полной нагрузкой сокета. В агентных системах многие задачи, такие как последовательные шаги в симуляции или логика принятия решений, требуют высокой однопоточной производительности. Более быстрые ядра позволяют каждому агенту быстрее завершать свои шаги, генерировать токены и переходить к следующему действию, что напрямую влияет на общую продуктивность системы.
Три главных вызова для CPU в AI-фабриках
Когда выполнение на стороне CPU замедляется, это оказывает негативное влияние на весь кластер GPU тремя основными способами:
- Снижение качества обучения с подкреплением (RL): GPU получает меньше полезных оценок (evaluations) за цикл, что приводит к увеличению времени обучения и ухудшению качества градиентов.
- Увеличение времени отклика для пользователей: Флот GPU тратит больше времени на ожидание завершения задач CPU, что делает сервис менее отзывчивым.
- Вытеснение KV-кэша: Из-за задержек CPU система вынуждена удалять контекст из памяти GPU, чтобы освободить место для других запросов. Когда запрос возвращается, GPU приходится заново обрабатывать предыдущую последовательность, что является крайне затратной операцией.

02Ускорение обучения с подкреплением (RL) через ядра Olympus
Обучение с подкреплением (Reinforcement Learning, RL) меняет парадигму вычислений, вводя непрерывную интерактивную петлю обратной связи между GPU и CPU. В отличие от традиционного обучения, где данные просто потоком поступают на ускорители, RL требует активного генерирования данных опыта. Этот этап, часто называемый «роллаутами среды» (environment rollouts) или симуляциями, сильно зависит от последовательной, логически сложной обработки, которую выполняет CPU.
В RL градиенты — это математические инструкции, которые говорят нейронной сети, как улучшить свою политику. Эти градиенты полностью зависят от сигналов обучения, таких как обратная связь и вознаграждения, генерируемые в средах CPU. Поскольку сложные задачи требуют глубокой последовательной обработки, производительность на одно ядро CPU напрямую влияет на то, сколько сред могут завершить оценки в рамках окна обучения.
Исследования показывают, что базовые CPU могут завершить лишь около 45% своих оценок в заданное время, оставляя GPU простаивающим в ожидании обратной связи. Архитектура NVIDIA Vera решает эту проблему, максимизируя устойчивую производительность на ядро под полной нагрузкой. Благодаря ядрам Olympus, которые работают в 1,8 раза быстрее базовых решений, Vera CPU способна завершить до 85% оценок за то же время.
Технические особенности ядер Olympus, влияющие на производительность RL, включают:
- Нейронный предиктор ветвлений (Neural branch predictor): Позволяет конвейеру инструкций продолжать работу даже при сложном управлении потоком в коде агентов.
- Декодировщик шириной 10 инструкций (10-wide decode front end): Подает больше инструкций в исполнение за такт, улучшая общую пропускную способность CPU.
- Глубокое исполнение вне порядка (Deep out-of-order execution): Позволяет процессору продвигаться вперед, обходя операции с высокой задержкой, что критично для нерегулярных рабочих нагрузок RL.
- NVIDIA Spatial Multithreading: Поддерживает высокую производительность на ядро даже при масштабировании на тысячи параллельных сред.

03Предсказуемая низкая задержка для интерактивных агентов
Переход от офлайн-обучения к живым, интерактивным развертываниям агентов сдвигает фокус оптимизации с чистой пропускной способности на строгую, предсказуемую задержку. В таких средах ИИ-агент работает автономно, чтобы решить сложную задачу пользователя, выполняя цепочку действий. Каждый шаг требует запуска вызова инструмента, выполнения кода, компиляции теста или запроса к данным.
Для поддержания такой отзывчивости на масштабе недостаточно просто низкой средней задержки. Агентам требуется предсказуемая задержка, когда сокет загружен множеством одновременных песочниц, сервисов и задач обработки данных. Традиционные многокристальные (chiplet) архитектуры CPU часто страдают от «обрывов производительности» (performance cliffs), когда рабочие нагрузки перетекают между кристаллами или доменами sub-NUMA, вызывая задержки из-за сложных межкристальных соединений.
Архитектура Vera CPU избегает этой проблемы, используя монолитный вычислительный кристалл (monolithic compute die) для своих 88 ядер Olympus. Это устраняет необходимость в сложных пересылках данных между ядрами через разные кристаллы. В сочетании с большим унифицированным кэшем и NVIDIA Scalable Coherency Fabric (SCF) данные перемещаются по системе более равномерно.
Помимо задержки, агентам требуется огромная пропускная способность памяти. Тысячи одновременных песочниц, вызовов инструментов и запросов к базам данных должны перемещать большие, нерегулярные наборы данных, сохраняя состояние каждого агента близко к ядрам. Vera CPU использует энергоэффективную память LPDDR5x, обеспечивающую общую пропускную способность до 1,2 ТБ/с и до 14 ГБ/с на ядро. Это более чем в 3 раза превышает пропускную способность памяти на ядро у традиционных серверных CPU, потребляя при этом менее половины энергии.

04Максимизация вычислений GPU за счет сохранения KV-кэша
В агентном инференсе GPU не работает в одном непрерывном проходе. Одна сессия может включать множество шагов модели, разделенных задачами на стороне CPU: вызовами инструментов, выполнением кода, поиском или запросами к базам данных. В полностью загруженном дата-центре GPU не ждет, пока CPU завершит эти задачи. Вместо этого он берет новые запросы и новые активные контексты.
По мере накопления запросов сохранить KV-кэш (ключ-значение кэш, содержащий контекст предыдущих диалогов) для оригинального запроса становится все сложнее. Медленный CPU увеличивает разрыв между шагами вычислений GPU. Это повышает вероятность того, что система вытеснит KV-кэш оригинального запроса из памяти GPU, чтобы освободить место для других пользователей, чьи работы готовы к запуску.
Когда вызов инструмента наконец завершается, GPU может потребоваться восстановить предыдущий контекст, повторно обработав предыдущую последовательность как большой входной промпт, вместо того чтобы продолжить работу из кэшированного состояния. Это приводит к огромным потерям вычислительных ресурсов.
Процессоры Vera помогают сжать часть трассы, выполняемую на стороне CPU. Более быстрое выполнение инструментов, сильная производительность на ядро под нагрузкой, высокая пропускная способность памяти и предсказуемая задержка уменьшают время ожидания агентов между шагами GPU. В результате больше времени GPU тратится на полезную генерацию токенов, а не на восстановление контекста, делая производительность CPU прямым вкладчиком в эффективность GPU в насыщенных агентных системах.

05Технические характеристики и сравнение с x86
Архитектура NVIDIA Vera представляет собой значительный скачок в дизайне серверных процессоров для ИИ. Ниже приведено сравнение ключевых параметров, демонстрирующих преимущества новой архитектуры.
| Параметр | NVIDIA Vera CPU | Традиционный x86 CPU |
|---|---|---|
| Архитектура кристалла | Монолитный (88 ядер Olympus) | Часто многокристальный (chiplet) |
| Устойчивая производительность на ядро | В 1,8 раза выше | Базовый уровень |
| Пиковая задержка под нагрузкой | На 40% ниже | Выше из-за межкристальных задержек |
| Пропускная способность памяти на ядро | До 14 ГБ/с (LPDDR5x) | В 3 раза ниже |
| Энергоэффективность | Менее половины энергии x86 | Высокое энергопотребление |
Важно отметить, что эти показатели основаны на измеренных данных и могут меняться. Производительность Vera CPU с памятью LPDDR5X базировалась на последних поколениях x86-процессоров. Для разработчиков, работающих в России, это означает возможность локального развертывания высокопроизводительных кластеров, не зависящих от ограничений на поставки традиционных серверных чипов, при условии наличия соответствующей инфраструктуры.

06Что это значит на практике
Для инженеров и архитекторов, проектирующих AI-фабрики, внедрение NVIDIA Vera CPU означает переход от оптимизации только GPU к системному подходу. Теперь можно рассчитывать на то, что узкие места в логике агентов, вызовах инструментов и управлении контекстом будут минимизированы.
Во-первых, время обучения моделей с подкреплением сократится. Более быстрая генерация опыта на CPU позволяет GPU чаще обновлять веса модели, что ускоряет выход на нужное качество.
Во-вторых, интерактивные сервисы станут более отзывчивыми. Предсказуемая задержка гарантирует, что пользователи не будут сталкиваться с «зависаниями» при сложных запросах, требующих множества шагов рассуждения и действий.
В-третьих, экономическая эффективность дата-центров возрастет. За счет сохранения KV-кэша в памяти GPU и снижения необходимости в повторных вычислениях, каждый доллар, вложенный в вычислительные мощности, будет приносить больше полезной работы. Это особенно важно в условиях растущих требований к масштабируемости агентных систем.
Архитектура NVIDIA Vera демонстрирует, что будущее ИИ-индустрии лежит не только в создании более больших моделей, но и в создании более эффективной инфраструктуры, которая позволяет этим моделям работать автономно, быстро и надежно. CPU перестает быть просто «фоновым» компонентом и становится активным участником вычислительного процесса, определяющим успех всего AI-кластера.
Источник: NVIDIA Developer ↗
