Инструменты29 июля 2026 г., 05:16 МСК🤖 Auto

HeraSys: ускорение LLM-воркфлоу в 2 раза за счет межзадачной оптимизации

Новая система HeraSys решает проблему изолированной обработки LLM-запросов, объединяя вычисления разных агентов. Это снижает P99 задержку в 2,17 раза и увеличивает пропускную способность на 85%.

Баннер новости 4595

Проблема изолированных воркфлоу

С развитием агентов на базе больших языковых моделей (LLM) системы обслуживания перешли от обработки одиночных запросов к оркестровке сложных многопользовательских рабочих процессов. Однако существующие решения фокусируются преимущественно на оптимизации внутри одного воркфлоу, игнорируя огромный потенциал межзадачной оптимизации. Это приводит к дублированию вычислений и неэффективному использованию ресурсов GPU.

Решение: HeraSys

Исследователи представили HeraSys — систему обслуживания LLM, которая оптимизирует производительность конкурентных воркфлоу на уровне конечной точки. Ключевые инновации включают:

  • Структурное слияние узлов: система выявляет и объединяет повторяющиеся вычислительные узлы в разных воркфлоу, устраняя кросс-воркфлоу избыточность.
  • Планировщик, учитывающий нагрузку: динамическое управление порядком выполнения на основе приоритетов как внутри, так и между запросами.
  • Адаптивное батчинг и декомпозиция конвейера: механизмы для смягчения «хвостовой» задержки (tail latency) при сохранении низкой средней задержки.

Результаты бенчмарков

Экстенсивные эксперименты показали значительное улучшение метрик при строгих гарантиях по задержке. Система эффективно масштабируется, обрабатывая больше запросов за то же время.

Метрика Показатель улучшения Значение
Снижение P99 Latency До 2.17x
Увеличение Throughput До 1.85x
Контекст Условие Строгие гарантии задержки

Значение для индустрии

Работа, принятая к публикации в ICML 2026 (авторы: Size Li, Zhiqing Tang и др.), демонстрирует сдвиг парадигмы: от оптимизации отдельных моделей к оптимизации всей экосистемы взаимодействующих агентов. Для компаний, развертывающих сложные LLM-приложения, внедрение подобных систем может привести к существенной экономии на инфраструктуре и улучшению пользовательского опыта за счет предсказуемости отклика.

Источник: arXiv cs.AI ↗