Проблема независимости в стохастическом режиме
Спекулятивное декодирование (Speculative Decoding) ускоряет инференс больших языковых моделей (LLM), используя легковесную модель-черновик (drafter) для предложения нескольких будущих токенов, которые затем верифицируются целевой моделью. Однако современные методы, основанные на блоках или диффузии, часто оптимизированы для жадного декодирования (greedy decoding) или предполагают условную независимость позиций в блоке черновика. Это предположение становится критически слабым в стохастическом режиме, где целевое распределение намеренно является вероятностным, и возможны множественные продолжения текста.
Решение: DBLAST с зависимым черновиком
Авторы исследования (Amirmohammad Karimi, Chao Gao, Negar Hassanpour) предлагают метод DBLAST (Dependent Block Drafting for Stochastic Speculative Decoding). В основе подхода лежит использование низкоуровневого латентного смешанного распределения (low-rank latent mixture) над позициями токенов. Это позволяет модели учитывать зависимости между токенами в блоке черновика. Кроме того, введена специфическая функция обучения (acceptance-oriented training objective), которая напрямую оптимизирует ожидаемую длину верифицированного блока, а не просто вероятность токенов.
Экспериментальные результаты
Эксперименты проводились на моделях Qwen3-4B и Qwen3-8B в задачах математического рассуждения (GSM8K), оценки диалогов (MT-Bench), генерации кода (HumanEval) и креативного письма. Ключевым выводом стало то, что DBLAST стабильно увеличивает длину принятых черновиков (accepted draft length) по сравнению с независимым блочным сэмплированием, особенно в режимах с высокой энтропией декодирования.
| Метрика / Параметр | Значение / Описание |
|---|---|
| Основная проблема | Деградация длины принятого черновика при росте энтропии целевого распределения |
| Архитектура черновика | Low-rank latent mixture over token positions (зависимый блок) |
| Целевая функция обучения | Оптимизация ожидаемой длины верифицированного блока (expected verified length) |
| Тестовые модели | Qwen3-4B, Qwen3-8B |
| Бенчмарки | GSM8K, MT-Bench, HumanEval, Creative-writing |
Почему это важно
Результаты показывают, что игнорирование зависимостей между токенами в блоке черновика приводит к существенным потерям в эффективности ускорения при использовании температурного или стохастического сэмплирования. DBLAST демонстрирует, что учет этих зависимостей через латентные смеси позволяет сохранить высокую скорость инференса даже в сложных, креативных сценариях генерации, где традиционные методы спекулятивного декодирования теряют эффективность.
Источник: arXiv cs.CL ↗
