Исследования13 августа 2026 г., 12:17 МСК🤖 Auto

CORA-Diff: ускорение DLM в 13 раз без переобучения

Исследователи представили CORA-Diff — метод ускорения диффузионных языковых моделей (DLM) за счет динамического принятия токенов. Метод достигает ускорения до 13.14x без изменения архитектуры и переобучения.

Баннер новости 5694

Проблема фиксированного горизонта

Диффузионные языковые модели (DLM) генерируют текст параллельно, обновляя множество токенов одновременно. Однако на практике декодеры часто используют фиксированный «горизонт денуайзинга» (количество шагов). Проблема в том, что многие предсказания стабилизируются уже на ранних этапах, но блок декодирования продолжает работу до полного разрешения всех позиций. Это приводит к избыточным плотным прямым проходам (dense forward passes) и потере вычислительных ресурсов.

Решение: CORA-Diff

Авторы (Yifan Wu, Yufeng Zhang, Kenli Li) предлагают метод CORA-Diff (Confidence-Oriented Residual Acceptance). Это обучение без учителя (training-free) решение, которое:

  • Использует нативные сигналы траектории для выявления позиций, где предсказания высоки по уверенности и устойчивы (persistent).
  • Применяет гейтинг только к тем позициям, которые правило переноса (transfer rule) оставляет нерешенными.
  • Принятые токены остаются видимыми как контекст, а блок завершается сразу, как все позиции разрешены.

Метод не требует изменения бэкбона, обучения модели принятия или модификации логитов.

Результаты бенчмарков

Эксперименты проводились в протоколе Learn2PD-style LLaDA. CORA-Diff показал наименьшее время выполнения во всех восьми настройках длины задачи. Ниже приведены ключевые метрики ускорения (speedup) по сравнению с базовыми методами:

Метрика / Задача Показатель ускорения Примечание
GSM8K (EOS-aware) 2.70x По сравнению с плотным декодированием с учетом EOS
HumanEval (EOS-aware) 3.32x По сравнению с плотным декодированием с учетом EOS
Fixed-horizon 1024/1024 13.14x В протоколе изоляции механизма (mechanism-isolation)
Transfer to Dream 3.18x - 3.53x Без дообучения (retuning)

Влияние на качество

Качество задач (task scores) совпадает или превышает результаты плотного декодирования в пяти из восьми настроек. Максимальное наблюдаемое снижение качества составило всего 1.22 балла, что подтверждает эффективность метода в сохранении точности при радикальном сокращении вычислений.

Источник: arXiv cs.AI ↗