Исследования31 августа 2026 г., 10:18 МСК🤖 Auto

Ускорение диффузионных LLM в 14 раз: Trajectory-Level Speculative Decoding

Исследователи представили метод Trajectory-Level Speculative Decoding, который ускоряет генерацию в диффузионных языковых моделях (dLLM) до 14 раз, сохраняя точность на уровне базовых решений.

Баннер новости 6401

Проблема параллельной генерации

Диффузионные языковые модели (dLLM) предлагают уникальный подход к генерации текста, создавая токены параллельно через итеративное «зашумление» и последующее восстановление (denoising). Однако существующие стратегии декодирования сталкиваются с серьезным ограничением: при низкой уверенности модели процесс сворачивается к последовательной генерации одного токена за раз. Это критически снижает пропускную способность (throughput) и нивелирует преимущества параллельности.

Суть метода: Траектории вместо токенов

В отличие от авторегрессионных моделей, где спекулятивное декодирование работает с последовательностью токенов слева направо, dLLM требуют спекуляции над траекториями денуайзинга. Авторы предлагают фреймворк, который строит черновые траектории с помощью дерева поиска, стратифицированного по уровню уверенности, и проверяет их через блочную параллельную оценку с двунаправленной маской внимания. Ключевым нововведением является inter-block speculation — возможность кросс-блокового прогнозирования, использующая двунаправленную структуру диффузионных моделей.

Результаты бенчмарков

Метод был протестирован на задачах рассуждений (reasoning) и написания кода. Использование инфраструктуры двойного кэша Fast-dLLM позволило достичь значительных улучшений производительности. Сравнение эффективности представлено ниже:

Метрика Vanilla dLLM Fast-dLLM Proposed Method
Ускорение (Speedup) 1x (Baseline) ~5.3x 7–14x
Ускорение относительно Fast-dLLM 1x 1.3x
Токенов за шаг (Tokens/step) 2.6 4.3
Снижение итераций денуайзинга 30–40%
Изменение точности < 1%

Почему это важно

Результаты показывают, что предложенный подход не просто ускоряет вычисления, но и эффективно решает фундаментальную проблему «дрейфа траекторий» (trajectory drift) — основную стоимость увеличения параллелизма в dLLM. Снижение количества итераций денуайзинга на 30-40% при минимальной потере точности делает диффузионные модели значительно более конкурентоспособными по сравнению с традиционными авторегрессионными архитектурами для задач, требующих высокой скорости генерации.

Источник: arXiv cs.CL ↗