Проблема параллельной генерации
Диффузионные языковые модели (dLLM) предлагают уникальный подход к генерации текста, создавая токены параллельно через итеративное «зашумление» и последующее восстановление (denoising). Однако существующие стратегии декодирования сталкиваются с серьезным ограничением: при низкой уверенности модели процесс сворачивается к последовательной генерации одного токена за раз. Это критически снижает пропускную способность (throughput) и нивелирует преимущества параллельности.
Суть метода: Траектории вместо токенов
В отличие от авторегрессионных моделей, где спекулятивное декодирование работает с последовательностью токенов слева направо, dLLM требуют спекуляции над траекториями денуайзинга. Авторы предлагают фреймворк, который строит черновые траектории с помощью дерева поиска, стратифицированного по уровню уверенности, и проверяет их через блочную параллельную оценку с двунаправленной маской внимания. Ключевым нововведением является inter-block speculation — возможность кросс-блокового прогнозирования, использующая двунаправленную структуру диффузионных моделей.
Результаты бенчмарков
Метод был протестирован на задачах рассуждений (reasoning) и написания кода. Использование инфраструктуры двойного кэша Fast-dLLM позволило достичь значительных улучшений производительности. Сравнение эффективности представлено ниже:
| Метрика | Vanilla dLLM | Fast-dLLM | Proposed Method |
|---|---|---|---|
| Ускорение (Speedup) | 1x (Baseline) | ~5.3x | 7–14x |
| Ускорение относительно Fast-dLLM | — | 1x | 1.3x |
| Токенов за шаг (Tokens/step) | 2.6 | — | 4.3 |
| Снижение итераций денуайзинга | — | — | 30–40% |
| Изменение точности | — | — | < 1% |
Почему это важно
Результаты показывают, что предложенный подход не просто ускоряет вычисления, но и эффективно решает фундаментальную проблему «дрейфа траекторий» (trajectory drift) — основную стоимость увеличения параллелизма в dLLM. Снижение количества итераций денуайзинга на 30-40% при минимальной потере точности делает диффузионные модели значительно более конкурентоспособными по сравнению с традиционными авторегрессионными архитектурами для задач, требующих высокой скорости генерации.
Источник: arXiv cs.CL ↗
