Суть проблемы: Agentic AI — это не просто LLM
Команда исследователей из Microsoft (Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic) провела первое масштабное архитектурное исследование рабочих процессов Agentic AI на базе данных производства Microsoft Azure. Оказалось, что классические серверы, оптимизированные под статичные LLM-инференсы, не справляются с новой нагрузкой. Запрос пользователя распадается на сложный воркфлоу: цепочки LLM-инференсов, вызовы инструментов (tools) и решения оркестратора. Эти этапы постоянно пересекают границу CPU-GPU, создавая фрагментированную и гетерогенную нагрузку.
Почему традиционные серверы «умирают» от агентов
Ключевая проблема заключается в том, что оркестрация и работа с инструментами выполняются на хост-процессоре (CPU), который оказывается на критическом пути. В то же время GPU простаивает или перегружается неравномерно. Исследование выделяет три главных архитектурных конфликта:
- Фрагментация ресурсов: CPU и GPU не могут быть использованы эффективно из-за скачкообразного характера запросов (bursty demand).
- Неэффективное распределение CPU: Разные роли в софте требуют разных характеристик процессора, что делает однородную поставку CPU неэффективной.
- Потеря локальности: Мультиплексирование множества агентов на общие ядра разрушает микроархитектурную локальность, что критически важно для производительности.
Решение от Microsoft: Прототип Agora
На основе полученных данных команда разработала прототип серверной архитектуры под названием Agora. Его главная цель — адаптировать коммерческие серверы под гетерогенность Agentic AI. Agora внедряет три ключевых механизма:
- Динамический сбор CPU-ядер: Система использует простаивающие ядра для сопутствующих задач (throughput work), защищая при этом хвостовую задержку (tail latency) агентов от всплесков вызова инструментов.
- Оверсубскрипция GPU-памяти: На один GPU размещается больше агентов, чем позволяет физическая память. Задержки обмена с диском (swap) скрываются за счет предварительной выборки (prefetching) состояния следующего агента.
- Пуллинг ядер по ролям: Ядра группируются по функциональному назначению, а планировщик учитывает аффинность, восстанавливая микроархитектурную локальность.
Результаты и сравнение подходов
Внедрение механизмов Agora позволяет существенно повысить утилизацию серверов и общую пропускную способность, не жертвуя качеством обслуживания агентов. Ниже приведено сравнение традиционного подхода и архитектуры Agora, предложенной исследователями.
| Параметр | Традиционные серверы (Uniform) | Аркаитектура Agora (Agentic-optimized) |
|---|---|---|
| Управление CPU | Однородное распределение, неэффективно для оркестрации | Пуллинг по ролям + аффинное планирование |
| Использование GPU | Статичное, риск простоя или перегрузки | Оверсубскрипция памяти + prefetching состояний |
| Обработка пиков (Spikes) | Рост задержки (tail latency), блокировка потока | Динамический сбор idle-ядер для защиты latency |
| Микроархитектурная локальность | Нарушается при мультиплексировании агентов | Восстанавливается через affinity-aware scheduling |
Исследование, опубликованное 5 августа 2026 года, открывает новые направления для проектирования дата-центров будущего, где железо должно быть гибким и «понимать» семантику агентов, а не просто обрабатывать тензоры.
Источник: arXiv cs.AI ↗
