Исследования12 сентября 2026 г., 10:18 МСК🤖 Auto

Как ускорить Agentic LLM в 3.5 раза: новый метод планирования

Исследователи представили метод планирования, который отделяет готовность токена от его отправки в очередь, снижая P95 задержки агентов LLM до 3.5 раз.

Баннер новости 7340

Проблема «жадного» релиза в Agentic LLM

Agentic LLM-рабочие процессы состоят из последовательных вызовов моделей, прерываемых взаимодействием с инструментами. Ключевая проблема современных рантаймов — политика eager release (жадный релиз): как только токен готов, он немедленно отправляется в очередь выполнения. При высокой нагрузке это приводит к накоплению «незавершенной работы», которую уже невозможно переупорядочить на уровне всего воркфлоу, что критически увеличивает хвостовые задержки (tail latency).

Решение: Tail-Aware Scheduling

Авторы (Bochao Feng, Jianjiang Li и др.) предлагают метод, который разделяет моменты готовности токена и его фактической отправки в очередь. Алгоритм использует mean-Conditional Value-at-Risk (CVaR) для оценки рисков хвостового распределения задержек. Он динамически решает:

  • Какой именно готовый токен отправить следующим;
  • Какой объем «выпущенной, но не завершенной» работы поддерживать в очереди.

Метод адаптирует бюджет выпускаемой работы на основе давления в очереди (queue pressure) и использует онлайн-оценки объема работы для каждого токена.

Результаты бенчмарков

Оценка проводилась на реальных трейсах выполнения агентов для задач программной инженерии. Метод демонстрирует стабильность при низкой нагрузке и существенное ускорение при конкуренции ресурсов. Сравнение метрик эффективности представлено ниже:

Метрика / Условие Жадный релиз (Baseline) Tail-Aware Scheduling (Предложенный метод)
Нагрузка: Низкая (Light load) Базовая производительность Сопоставимая производительность
Нагрузка: Высокая (Contention) Высокая P95 задержка Ускорение до 3.50x
Метрика оптимизации Снижение P95 workflow flow time

Значение для индустрии

Результат показывает, что управление очередями на уровне всего агента, а не отдельных токенов, позволяет радикально снизить задержки в сложных сценариях. Это критически важно для продакшн-систем, где стабильность времени отклика (SLA) важнее максимальной пропускной способности в пиковые моменты.

Источник: arXiv cs.AI ↗