Исследования16 сентября 2026 г., 09:17 МСК🤖 Auto

Calibrate, Then Route: Как обученный роутинг ускорил LLM-инференс

Исследователи представили систему маршрутизации запросов для дисагрегированного LLM-сервисинга, которая повышает goodput на 3-4% по сравнению с базовыми методами, экономя до одного GPU.

Баннер новости 7605

Суть проблемы: префилл и декод

В современных системах обслуживания больших языковых моделей (LLM), таких как DistServe, Splitwise и Mooncake, вычислительно тяжелая фаза префилла (prefill) и требовательная к памяти фаза декодирования (decode) размещаются на отдельных пулах GPU. Ключевая задача — эффективно маршрутизировать запросы между этими пулами. Авторы исследования предлагают подход "Calibrate, Then Route", где роутер обучается предсказывать дополнительное время завершения запроса на каждом экземпляре.

Методология и метрики

Политика маршрутизации разработана в симуляторе дискретных событий и валидирована на реальном железе: 8 GPU NVIDIA A40 с движком vLLM и передачей KV-кэшей через NIXL. Роутер учитывает точную длину промпта, предсказанную длину вывода, давление KV-кэша после принятия запроса и класс SLO. Сравнение проводилось на трех смешанных, «bursty» (волновых) трафиках при измеренной насыщенности.

Результаты: таблица сравнения

Калиброванный роутер показал наилучшие результаты по среднему goodput (эффективной пропускной способности) и наименьшую дисперсию. Ниже приведены ключевые метрики эффективности:

Метод маршрутизации Средний Goodput Примечание
Calibrated Router (предлагаемый) 0.864 Наивысший результат, низкая дисперсия
Round Robin (Круговой) 0.835 Базовый метод
Least Loaded (Наименее загруженный) 0.847 Превосходит Round Robin, но уступает новому методу
Length Heuristic (По длине) 0.835-0.847* Уступает во всех тестах

*Диапазон для Length Heuristic основан на сравнении с другими базовыми методами в тексте.

Важность калибровки

Исследование выявило критическую зависимость от аппаратной калибровки. Использование констант, полученных исключительно из симулятора, снижает goodput на 4.5 пункта и лишает систему около 40% преимущества по хвостовой латентности. Без калибровки роутер превращается в простой счетчик очередей. Эффект от внедрения метода возрастает с увеличением размера пула декодирования и гетерогенностью трафика.

Практическая польза: экономия ресурсов

Главный вывод для инженеров: при наличии калиброванных затрат обученный роутер достигает того же goodput, что и Round Robin, но используя 6 GPU вместо 7. Это демонстрирует прямую финансовую выгоду от внедрения интеллектуального роутинга. Однако в условиях крайней нехватки ресурсов (пулы из 3 экземпляров) сложные стратегии могут уступать простому распределению, где подсчет очередей оказывается достаточным.

Источник: arXiv cs.AI ↗