Исследования6 августа 2026 г., 11:16 МСК🤖 Auto

Агрессивный AI ломает серверы: как Azure и Agora решают проблему CPU/GPU

Исследование Microsoft Azure выявило критические архитектурные несоответствия традиционных дата-центров для Agentic AI. Представлен прототип Agora, повышающий утилизацию за счет оверсубскрипции GPU и пулинга CPU.

Баннер новости 5196

Суть проблемы: Agentic AI — это не просто LLM

Команда исследователей из Microsoft (Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic) провела первое масштабное архитектурное исследование рабочих процессов Agentic AI на базе данных производства Microsoft Azure. Оказалось, что классические серверы, оптимизированные под статичные LLM-инференсы, не справляются с новой нагрузкой. Запрос пользователя распадается на сложный воркфлоу: цепочки LLM-инференсов, вызовы инструментов (tools) и решения оркестратора. Эти этапы постоянно пересекают границу CPU-GPU, создавая фрагментированную и гетерогенную нагрузку.

Почему традиционные серверы «умирают» от агентов

Ключевая проблема заключается в том, что оркестрация и работа с инструментами выполняются на хост-процессоре (CPU), который оказывается на критическом пути. В то же время GPU простаивает или перегружается неравномерно. Исследование выделяет три главных архитектурных конфликта:

  • Фрагментация ресурсов: CPU и GPU не могут быть использованы эффективно из-за скачкообразного характера запросов (bursty demand).
  • Неэффективное распределение CPU: Разные роли в софте требуют разных характеристик процессора, что делает однородную поставку CPU неэффективной.
  • Потеря локальности: Мультиплексирование множества агентов на общие ядра разрушает микроархитектурную локальность, что критически важно для производительности.

Решение от Microsoft: Прототип Agora

На основе полученных данных команда разработала прототип серверной архитектуры под названием Agora. Его главная цель — адаптировать коммерческие серверы под гетерогенность Agentic AI. Agora внедряет три ключевых механизма:

  1. Динамический сбор CPU-ядер: Система использует простаивающие ядра для сопутствующих задач (throughput work), защищая при этом хвостовую задержку (tail latency) агентов от всплесков вызова инструментов.
  2. Оверсубскрипция GPU-памяти: На один GPU размещается больше агентов, чем позволяет физическая память. Задержки обмена с диском (swap) скрываются за счет предварительной выборки (prefetching) состояния следующего агента.
  3. Пуллинг ядер по ролям: Ядра группируются по функциональному назначению, а планировщик учитывает аффинность, восстанавливая микроархитектурную локальность.

Результаты и сравнение подходов

Внедрение механизмов Agora позволяет существенно повысить утилизацию серверов и общую пропускную способность, не жертвуя качеством обслуживания агентов. Ниже приведено сравнение традиционного подхода и архитектуры Agora, предложенной исследователями.

Параметр Традиционные серверы (Uniform) Аркаитектура Agora (Agentic-optimized)
Управление CPU Однородное распределение, неэффективно для оркестрации Пуллинг по ролям + аффинное планирование
Использование GPU Статичное, риск простоя или перегрузки Оверсубскрипция памяти + prefetching состояний
Обработка пиков (Spikes) Рост задержки (tail latency), блокировка потока Динамический сбор idle-ядер для защиты latency
Микроархитектурная локальность Нарушается при мультиплексировании агентов Восстанавливается через affinity-aware scheduling

Исследование, опубликованное 5 августа 2026 года, открывает новые направления для проектирования дата-центров будущего, где железо должно быть гибким и «понимать» семантику агентов, а не просто обрабатывать тензоры.

Источник: arXiv cs.AI ↗