Исследования17 августа 2026 г., 09:17 МСК🤖 Auto

Год в LLM: как менялись запросы к моделям за 365 дней

Исследователи из Northwestern и других вузов опубликовали первый годовой трейс продакшн-нагрузки Chutes, раскрыв эволюцию пользовательских запросов и проблемы кэширования.

Баннер новости 5894

Масштаб исследования: 365 дней реальных данных

Команда авторов во главе с Уильямом Никсоном (William Nixon) представила лонгитюдное исследование рабочей нагрузки (workload) больших языковых моделей (LLM). В отличие от предыдущих работ, ограниченных короткими периодами или синтетическими данными, этот анализ базируется на полном годовом трейсе платформы Chutes. Данные охватывают взаимодействие множества пользователей с широким спектром моделей — от популярных лидеров до длинного хвоста (long-tail) нишевых решений.

Ключевые метрики и структура нагрузки

Исследование показывает, что нагрузка на LLM-сервисы не статична. Авторы проанализировали трафик с четырех перспектив: агрегированной, временной, модельной и пользовательской. Выявлено, что паттерны запросов эволюционируют: пользователи постепенно осваивают новые возможности моделей, что меняет распределение длин входных контекстов и частоту обращений. Это критически важно для проектирования систем балансировки нагрузки, так как пиковые нагрузки смещаются в зависимости от трендов использования конкретных архитектур.

Проблема кэширования и балансировки

Особое внимание уделено эффективности кэширования. Анализ показал, что стандартные подходы к кэшированию часто не учитывают долгосрочную эволюцию запросов. Повторяемость запросов (request repetition) варьируется в зависимости от типа модели и времени суток. Для оптимизации затрат и задержек (latency) необходимо внедрять адаптивные алгоритмы, учитывающие не только текущий, но и исторический паттерн запросов.

Открытые данные для сообщества

Для стимулирования дальнейших исследований авторы опубликуют полный годовой трейс. Это позволит разработчикам LLM-serving систем (таких как vLLM, TGI, TensorRT-LLM) тестировать свои решения на реалистичных, а не смоделированных данных. Исследование подчеркивает необходимость перехода от краткосрочных бенчмарков к долгосрочному мониторингу производительности в продакшене.

Параметр Значение / Характеристика
Источник данных Платформа Chutes
Длительность сбора 1 год (365 дней)
Охват моделей Популярные + Long-tail (нишевые)
Уровень детализации Пользовательский, модельный, временной
Ключевая проблема Эволюция workload и эффективность кэширования

Почему это важно для индустрии

Понимание того, как пользователи взаимодействуют с моделями в долгосрочной перспективе, позволяет оптимизировать инфраструктурные затраты. Ошибки в оценке пиковых нагрузок или игнорирование эволюции запросов приводят к неэффективному распределению GPU-ресурсов. Публикация этих данных становится новым стандартом для валидации систем обслуживания LLM.

Источник: arXiv cs.AI ↗