Исследования22 сентября 2026 г., 12:18 МСК🤖 Auto

TreeSpark: Ускорение LLM на 14% за счет адаптивных деревьев

Исследователи представили TreeSpark — метод спекулятивного декодирования, который динамически масштабирует размер дерева черновиков в зависимости от нагрузки, обеспечивая прирост скорости до 14%.

Баннер новости 8029

Проблема фиксированных деревьев

Современные методы спекулятивного декодирования (Speculative Decoding) используют дешевую модель-черновик (drafter) для генерации токенов, которые затем верифицирует основная модель. Хотя блочные черновики (block drafters) делают генерацию почти бесплатной, использование деревьев черновиков (draft trees) сталкивается с двумя критическими проблемами:

  • Ошибка ранжирования: Существующие подходы ранжируют кандидатов по маргинальным вероятностям, игнорируя родительский контекст. В полуавтоматических (semi-autoregressive) моделях это приводит к тому, что расширение дерева добавляет нерелевантные узлы.
  • Игнорирование нагрузки: Фиксированный размер дерева не учитывает текущую загрузку сервера. При высокой нагрузке избыточное дерево создает лишние вычисления, а при низкой — упускает возможности ускорения.

Решение TreeSpark

Авторы (Huapeng Zhou, Huayu Wang, Xinyu Wang) предлагают алгоритм, который использует марковскую голову (Markov head) черновика для оценки вероятности принятия ребра (edge-acceptance). Ключевые инновации:

  1. Калибровка по пути: Алгоритм оценивает выживаемость пути (path survival), а не просто отдельных токенов.
  2. Адаптивность: Размер дерева динамически меняется. При росте нагрузки система автоматически сужает дерево до простой цепочки (chain), экономя ресурсы.
  3. Безпотерное декодирование: Выбор братьев без повторений (sampling without replacement) и рекурсивное отклонение остатков (recursive rejection) гарантируют, что качество генерации не страдает при любой температуре.

Результаты бенчмарков

Эксперименты показали, что TreeSpark превосходит как фиксированные бюджеты, так и оптимизированные цепочки (tuned chains). Ниже приведены ключевые метрики ускорения:

Метрика Показатель TreeSpark Сравнение с базовым методом
Принятые токены за раунд +15–25% Против оптимизированной цепочки (chain)
Wall-clock время декодирования Быстрее на 8–14% В сценарии одиночного запроса (single-request)
Поведение под нагрузкой Graceful degradation Автоматическое сужение дерева до цепочки

Значение для индустрии

TreeSpark решает проблему «жесткости» существующих методов ускорения. Возможность адаптироваться к загрузке сервера делает этот подход особенно ценным для продакшн-инференса, где пиковые нагрузки могут резко снижать эффективность статических оптимизаций. Код и артефакты исследования уже доступны.

Источник: arXiv cs.CL ↗