Проблема изолированных воркфлоу
С развитием агентов на базе больших языковых моделей (LLM) системы обслуживания перешли от обработки одиночных запросов к оркестровке сложных многопользовательских рабочих процессов. Однако существующие решения фокусируются преимущественно на оптимизации внутри одного воркфлоу, игнорируя огромный потенциал межзадачной оптимизации. Это приводит к дублированию вычислений и неэффективному использованию ресурсов GPU.
Решение: HeraSys
Исследователи представили HeraSys — систему обслуживания LLM, которая оптимизирует производительность конкурентных воркфлоу на уровне конечной точки. Ключевые инновации включают:
- Структурное слияние узлов: система выявляет и объединяет повторяющиеся вычислительные узлы в разных воркфлоу, устраняя кросс-воркфлоу избыточность.
- Планировщик, учитывающий нагрузку: динамическое управление порядком выполнения на основе приоритетов как внутри, так и между запросами.
- Адаптивное батчинг и декомпозиция конвейера: механизмы для смягчения «хвостовой» задержки (tail latency) при сохранении низкой средней задержки.
Результаты бенчмарков
Экстенсивные эксперименты показали значительное улучшение метрик при строгих гарантиях по задержке. Система эффективно масштабируется, обрабатывая больше запросов за то же время.
| Метрика | Показатель улучшения | Значение |
|---|---|---|
| Снижение P99 Latency | До | 2.17x |
| Увеличение Throughput | До | 1.85x |
| Контекст | Условие | Строгие гарантии задержки |
Значение для индустрии
Работа, принятая к публикации в ICML 2026 (авторы: Size Li, Zhiqing Tang и др.), демонстрирует сдвиг парадигмы: от оптимизации отдельных моделей к оптимизации всей экосистемы взаимодействующих агентов. Для компаний, развертывающих сложные LLM-приложения, внедрение подобных систем может привести к существенной экономии на инфраструктуре и улучшению пользовательского опыта за счет предсказуемости отклика.
Источник: arXiv cs.AI ↗
