Масштаб исследования: 365 дней реальных данных
Команда авторов во главе с Уильямом Никсоном (William Nixon) представила лонгитюдное исследование рабочей нагрузки (workload) больших языковых моделей (LLM). В отличие от предыдущих работ, ограниченных короткими периодами или синтетическими данными, этот анализ базируется на полном годовом трейсе платформы Chutes. Данные охватывают взаимодействие множества пользователей с широким спектром моделей — от популярных лидеров до длинного хвоста (long-tail) нишевых решений.
Ключевые метрики и структура нагрузки
Исследование показывает, что нагрузка на LLM-сервисы не статична. Авторы проанализировали трафик с четырех перспектив: агрегированной, временной, модельной и пользовательской. Выявлено, что паттерны запросов эволюционируют: пользователи постепенно осваивают новые возможности моделей, что меняет распределение длин входных контекстов и частоту обращений. Это критически важно для проектирования систем балансировки нагрузки, так как пиковые нагрузки смещаются в зависимости от трендов использования конкретных архитектур.
Проблема кэширования и балансировки
Особое внимание уделено эффективности кэширования. Анализ показал, что стандартные подходы к кэшированию часто не учитывают долгосрочную эволюцию запросов. Повторяемость запросов (request repetition) варьируется в зависимости от типа модели и времени суток. Для оптимизации затрат и задержек (latency) необходимо внедрять адаптивные алгоритмы, учитывающие не только текущий, но и исторический паттерн запросов.
Открытые данные для сообщества
Для стимулирования дальнейших исследований авторы опубликуют полный годовой трейс. Это позволит разработчикам LLM-serving систем (таких как vLLM, TGI, TensorRT-LLM) тестировать свои решения на реалистичных, а не смоделированных данных. Исследование подчеркивает необходимость перехода от краткосрочных бенчмарков к долгосрочному мониторингу производительности в продакшене.
| Параметр | Значение / Характеристика |
|---|---|
| Источник данных | Платформа Chutes |
| Длительность сбора | 1 год (365 дней) |
| Охват моделей | Популярные + Long-tail (нишевые) |
| Уровень детализации | Пользовательский, модельный, временной |
| Ключевая проблема | Эволюция workload и эффективность кэширования |
Почему это важно для индустрии
Понимание того, как пользователи взаимодействуют с моделями в долгосрочной перспективе, позволяет оптимизировать инфраструктурные затраты. Ошибки в оценке пиковых нагрузок или игнорирование эволюции запросов приводят к неэффективному распределению GPU-ресурсов. Публикация этих данных становится новым стандартом для валидации систем обслуживания LLM.
Источник: arXiv cs.AI ↗
