Суть метода: Draft-and-Verify
Спекулятивное декодирование ускоряет генерацию текста, используя маленькую модель-черновик (draft model), которая предсказывает несколько токенов за один шаг. Крупная целевая модель (target model) затем проверяет их параллельно за один проход. Это снижает количество итераций декодирования, увеличивая арифметическую интенсивность вычислений, при этом сохраняя идентичность выходных данных по сравнению со стандартным авторегрессионным декодированием.
Ключевые метрики и бенчмарки
Для оценки эффективности NVIDIA представила бенчмарк SPEED-Bench, измеряющий длину принятия токенов (acceptance length) на реалистичных задачах, таких как кодирование и суммаризация. Ключевые параметры:
- Draft Length (D): количество предлагаемых токенов за итерацию.
- Acceptance Length (A): количество принятых токенов за итерацию.
- Speedup: отношение времени последовательной генерации к времени верификации с учетом накладных расходов на черновик.
5 правил оптимизации (Guidelines)
Авторы статьи выделяют пять стратегий выбора оптимальной длины черновика и механизма для нахождения на Парето-фронте производительности:
| Правило | Условие/Суть | Рекомендация |
|---|---|---|
| 1. Compute-Bound GEMM | Нужно сдвинуть GEMM в область, ограниченную вычислениями, не увеличивая давление на KV-кэш. | Увеличивать D, пока GEMM не достигнет пиковой производительности (TFLOPs). |
| 2. Attention-Dominated | Когда внимание (attention) доминирует во времени выполнения (например, в reasoning/agentic задачах). | Установить D = 128/G - 1, где G — группа заголовков (query heads per KV head). |
| 3. Tile Boundaries | Время выполнения attention растет ступенчато при пересечении границ тайлов ядра (128). | Предпочитать значения D, кратные 128, для эффективного использования тайлов. |
| 4. Low Latency | При очень низкой задержке накладные расходы на черновик становятся критичными. | Увеличивать D только если прирост принятия токенов оправдывает стоимость черновика. |
| 5. Выбор механизма | Баланс между длиной принятия, накладными расходами и стоимостью обучения/развертывания. | Сравнивать External Draft, EAGLE-3, MTP, DFlash, DSpark, Suffix/n-gram. |
Сравнение механизмов черновика
В исследовании сравниваются различные подходы к генерации черновика, каждый из которых имеет свои компромиссы:
- External Draft Models: Отдельные модели, требуют дополнительной памяти.
- EAGLE-3, DFlash, DSpark: Встроенные механизмы, оптимизированные для NVIDIA TensorRT LLM.
- Suffix/n-gram: Методы, основанные на статистике, с низкой вычислительной нагрузкой, но потенциально меньшей точностью.
Практическое применение
NVIDIA предоставляет готовые примеры обучения для EAGLE-3, DFlash и DSpark в репозитории NVIDIA/Model-Optimizer. Демонстрация проведена на модели Nemotron 3.5 Lightning, включая рабочие процессы тонкой настройки (fine-tuning) и квантования. Это позволяет разработчикам внедрить спекулятивное декодирование для значительного ускорения инференса LLM без изменения архитектуры целевой модели.
Источник: NVIDIA dev blog ↗
