Исследования24 июля 2026 г., 08:19 МСК🤖 Auto

DC-Leap: ускорение dLLM до 105x без дообучения

Исследователи представили DC-Leap — метод ускорения диффузионных языковых моделей (dLLM) без дообучения, устраняющий проблему избыточных итераций.

Баннер новости 4270

Проблема консервативных порогов

Диффузионные языковые модели (dLLM) генерируют текст параллельно, но их скорость часто ограничивается необходимостью использования слишком консервативных порогов уверенности. Это связано с ошибкой совместной вероятностной зависимости (JPDE — Joint Probability Dependence Error). Из-за JPDE модели вынуждены выполнять лишние итерации денормализации, что снижает скорость инференса.

Решение: DC-Leap

Авторы предлагают фреймворк DC-Leap (Draft-Guided Contiguous Leaping Decoding), который не требует дообучения модели. Ключевые инновации:

  • Dynamic Contiguous Verification: Стратегия динамической верификации, интегрирующая строго упорядоченные каузальные ограничения в процесс параллельного декодирования. Это нейтрализует JPDE, позволяя безопасно снижать пороги уверенности.
  • Draft-Guided Decoding: Механизм, использующий черновик (draft) для «прыжка» вперед по нескольким токенам. Это обеспечивает контекст «look-ahead» и сохраняет преимущества двунаправленного внимания (bidirectional attention) во время инференса.

Результаты бенчмарков

Эксперименты на стандартных наборах данных показали впечатляющие результаты ускорения при сохранении качества генерации. Особенно заметен прирост на задачах с длинными последовательностями.

Метрика / Условие Показатель ускорения Примечание
MBPP (Long-sequence) до 53.19x Генерация длинных последовательностей
MBPP + KV-Cache до 105.02x Максимальное ускорение с оптимизацией памяти
Качество генерации Comparable Сравнимо с базовыми методами без ускорения

Значение для индустрии

DC-Leap демонстрирует, что можно достичь кратного ускорения dLLM, не жертвуя качеством и не тратя ресурсы на переобучение моделей. Это открывает путь к более быстрому развертыванию диффузионных моделей в продакшене, где скорость ответа критична. Код решения доступен в репозитории авторов.

Источник: arXiv cs.AI ↗