Исследования23 июля 2026 г., 07:17 МСК🤖 Auto

FineServe: первый датасет реальных нагрузок LLM с разбивкой по моделям

Исследователи опубликовали FineServe — уникальный набор данных трафика коммерческой платформы LLM, раскрывающий реальные паттерны запросов, задержек и потребления токенов.

Баннер новости 4176

Проблема абстрактных бенчмарков

Развертывание больших языковых моделей (LLM) как always-on сервисов требует оптимизации под волатильный спрос. Существующие исследования часто опираются на прокси-трассы или грубую агрегацию данных, которые не отражают гетерогенность современных платформ, обслуживающих десятки разных моделей одновременно. Это создает разрыв между лабораторными тестами и реальной эксплуатацией.

Что такое FineServe

Команда авторов во главе с Тяньчэном Чжаном (Tiancheng Zhang) представила FineServe — датасет, собранный «в дикой природе» (in-the-wild) на глобальной коммерческой площадке LLM. В отличие от синтетических генераторов, FineServe фиксирует микроскопические детали работы сервисов: динамику поступления запросов, поведение токенов и специфику задач для различных архитектур моделей.

Ключевые находки исследования

Анализ данных выявил фундаментально разные режимы колебаний нагрузки в зависимости от типа модели, ее масштаба и намерения пользователя. Исследователи разработали генератор рабочих нагрузок FineServe, который позволяет составлять конфигурируемые смеси запросов, учитывающие специфику конкретных моделей. Это дает возможность тестировать стратегии маршрутизации, планирования ресурсов и масштабирования с высокой степенью реализма.

Значение для индустрии

Публикация FineServe закрывает критический пробел в системном проектировании LLM. Предоставляя доступ к реальным метрикам гетерогенного трафика, датасет становится фундаментом для оценки эффективности систем обслуживания (serving systems). Исследователи и инженеры теперь могут опираться на данные, отражающие реальную нагрузку, а не на упрощенные допущения.

Аспект Традиционные подходы Подход FineServe
Источник данных Синтетические генераторы / Прокси-трассы Реальный трафик глобальной коммерческой платформы
Гранулярность Грубая агрегация (общий QPS) Микроскопическая (по моделям, задачам, токенам)
Гетерогенность Часто игнорируется (одна модель) Учитывает микс различных архитектур и масштабов
Применение Базовое тестирование Оптимизация роутинга, планирования и масштабирования

Датасет и инструменты для работы с ним доступны для сообщества, что открывает новые возможности для оптимизации затрат и производительности в LLM-индустрии.

Источник: arXiv cs.AI ↗