Проблема консервативных порогов
Диффузионные языковые модели (dLLM) генерируют текст параллельно, но их скорость часто ограничивается необходимостью использования слишком консервативных порогов уверенности. Это связано с ошибкой совместной вероятностной зависимости (JPDE — Joint Probability Dependence Error). Из-за JPDE модели вынуждены выполнять лишние итерации денормализации, что снижает скорость инференса.
Решение: DC-Leap
Авторы предлагают фреймворк DC-Leap (Draft-Guided Contiguous Leaping Decoding), который не требует дообучения модели. Ключевые инновации:
- Dynamic Contiguous Verification: Стратегия динамической верификации, интегрирующая строго упорядоченные каузальные ограничения в процесс параллельного декодирования. Это нейтрализует JPDE, позволяя безопасно снижать пороги уверенности.
- Draft-Guided Decoding: Механизм, использующий черновик (draft) для «прыжка» вперед по нескольким токенам. Это обеспечивает контекст «look-ahead» и сохраняет преимущества двунаправленного внимания (bidirectional attention) во время инференса.
Результаты бенчмарков
Эксперименты на стандартных наборах данных показали впечатляющие результаты ускорения при сохранении качества генерации. Особенно заметен прирост на задачах с длинными последовательностями.
| Метрика / Условие | Показатель ускорения | Примечание |
|---|---|---|
| MBPP (Long-sequence) | до 53.19x | Генерация длинных последовательностей |
| MBPP + KV-Cache | до 105.02x | Максимальное ускорение с оптимизацией памяти |
| Качество генерации | Comparable | Сравнимо с базовыми методами без ускорения |
Значение для индустрии
DC-Leap демонстрирует, что можно достичь кратного ускорения dLLM, не жертвуя качеством и не тратя ресурсы на переобучение моделей. Это открывает путь к более быстрому развертыванию диффузионных моделей в продакшене, где скорость ответа критична. Код решения доступен в репозитории авторов.
Источник: arXiv cs.AI ↗
