Суть проблемы: префилл и декод
В современных системах обслуживания больших языковых моделей (LLM), таких как DistServe, Splitwise и Mooncake, вычислительно тяжелая фаза префилла (prefill) и требовательная к памяти фаза декодирования (decode) размещаются на отдельных пулах GPU. Ключевая задача — эффективно маршрутизировать запросы между этими пулами. Авторы исследования предлагают подход "Calibrate, Then Route", где роутер обучается предсказывать дополнительное время завершения запроса на каждом экземпляре.
Методология и метрики
Политика маршрутизации разработана в симуляторе дискретных событий и валидирована на реальном железе: 8 GPU NVIDIA A40 с движком vLLM и передачей KV-кэшей через NIXL. Роутер учитывает точную длину промпта, предсказанную длину вывода, давление KV-кэша после принятия запроса и класс SLO. Сравнение проводилось на трех смешанных, «bursty» (волновых) трафиках при измеренной насыщенности.
Результаты: таблица сравнения
Калиброванный роутер показал наилучшие результаты по среднему goodput (эффективной пропускной способности) и наименьшую дисперсию. Ниже приведены ключевые метрики эффективности:
| Метод маршрутизации | Средний Goodput | Примечание |
|---|---|---|
| Calibrated Router (предлагаемый) | 0.864 | Наивысший результат, низкая дисперсия |
| Round Robin (Круговой) | 0.835 | Базовый метод |
| Least Loaded (Наименее загруженный) | 0.847 | Превосходит Round Robin, но уступает новому методу |
| Length Heuristic (По длине) | 0.835-0.847* | Уступает во всех тестах |
*Диапазон для Length Heuristic основан на сравнении с другими базовыми методами в тексте.
Важность калибровки
Исследование выявило критическую зависимость от аппаратной калибровки. Использование констант, полученных исключительно из симулятора, снижает goodput на 4.5 пункта и лишает систему около 40% преимущества по хвостовой латентности. Без калибровки роутер превращается в простой счетчик очередей. Эффект от внедрения метода возрастает с увеличением размера пула декодирования и гетерогенностью трафика.
Практическая польза: экономия ресурсов
Главный вывод для инженеров: при наличии калиброванных затрат обученный роутер достигает того же goodput, что и Round Robin, но используя 6 GPU вместо 7. Это демонстрирует прямую финансовую выгоду от внедрения интеллектуального роутинга. Однако в условиях крайней нехватки ресурсов (пулы из 3 экземпляров) сложные стратегии могут уступать простому распределению, где подсчет очередей оказывается достаточным.
Источник: arXiv cs.AI ↗
