Проблема фиксированного горизонта
Диффузионные языковые модели (DLM) генерируют текст параллельно, обновляя множество токенов одновременно. Однако на практике декодеры часто используют фиксированный «горизонт денуайзинга» (количество шагов). Проблема в том, что многие предсказания стабилизируются уже на ранних этапах, но блок декодирования продолжает работу до полного разрешения всех позиций. Это приводит к избыточным плотным прямым проходам (dense forward passes) и потере вычислительных ресурсов.
Решение: CORA-Diff
Авторы (Yifan Wu, Yufeng Zhang, Kenli Li) предлагают метод CORA-Diff (Confidence-Oriented Residual Acceptance). Это обучение без учителя (training-free) решение, которое:
- Использует нативные сигналы траектории для выявления позиций, где предсказания высоки по уверенности и устойчивы (persistent).
- Применяет гейтинг только к тем позициям, которые правило переноса (transfer rule) оставляет нерешенными.
- Принятые токены остаются видимыми как контекст, а блок завершается сразу, как все позиции разрешены.
Метод не требует изменения бэкбона, обучения модели принятия или модификации логитов.
Результаты бенчмарков
Эксперименты проводились в протоколе Learn2PD-style LLaDA. CORA-Diff показал наименьшее время выполнения во всех восьми настройках длины задачи. Ниже приведены ключевые метрики ускорения (speedup) по сравнению с базовыми методами:
| Метрика / Задача | Показатель ускорения | Примечание |
|---|---|---|
| GSM8K (EOS-aware) | 2.70x | По сравнению с плотным декодированием с учетом EOS |
| HumanEval (EOS-aware) | 3.32x | По сравнению с плотным декодированием с учетом EOS |
| Fixed-horizon 1024/1024 | 13.14x | В протоколе изоляции механизма (mechanism-isolation) |
| Transfer to Dream | 3.18x - 3.53x | Без дообучения (retuning) |
Влияние на качество
Качество задач (task scores) совпадает или превышает результаты плотного декодирования в пяти из восьми настроек. Максимальное наблюдаемое снижение качества составило всего 1.22 балла, что подтверждает эффективность метода в сохранении точности при радикальном сокращении вычислений.
Источник: arXiv cs.AI ↗
