Исследования3 октября 2026 г., 05:20 МСК🤖 Auto

DEdit: Итеративное редактирование черновика ускоряет LLM в 5.97 раза

Исследователи представили DEdit — метод спекулятивного декодирования, где диффузионный черновик итеративно исправляет ошибки, достигая рекордного ускорения на моделях Qwen3.

Баннер новости 8834

Проблема независимых предсказаний

Спекулятивное декодирование (Speculative Decoding) ускоряет генерацию текстов большими языковыми моделями (LLM), позволяя легковесному «черновику» (drafter) предлагать токены, которые целевая модель проверяет параллельно. Однако существующие диффузионные черновики предсказывают токены независимо друг от друга. Это создает критическую уязвимость: одна ранняя ошибка приводит к отклонению всего последующего префикса, даже если дальше идут верные предсказания.

Решение: Итеративное редактирование (DEdit)

Авторы предлагают DEdit — диффузионный черновик, способный не только генерировать токены параллельно, но и итеративно редактировать их. Поздние предсказания служат двунаправленным контекстом для исправления ранних ошибок и расширения принятого префикса. Ключевым нововведением является метод обучения ProposalMix, который смешивает предсказания черновика с эталонными токенами (ground-truth) на основе уверенности модели при первом проходе.

Результаты на Qwen3

Эксперименты проводились на моделях Qwen3-4B и Qwen3-8B в семи бенчмарках. DEdit показал наивысшую макро-среднюю скорость принятия токенов (macro-average token acceptance) и ускорение по сравнению с авторегрессионной генерацией при жадном декодировании (greedy decoding). Метод ProposalMix позволил сократить количество вредных правок, сокращающих принятый префикс, вдвое.

Модель Ускорение (Speedup) Ключевая метрика
Qwen3-4B 5.72× Максимальное макро-ускорение
Qwen3-8B 5.97× Максимальное макро-ускорение

Важность контекста

Дополнительный анализ выявил, что использование причинного внимания (causal attention) вместо полного контекста снижает эффективность принятия токенов, особенно на предсказуемых выходах. Это доказывает, что доступ к будущему контексту является ключевым фактором прироста производительности DEdit.

Источник: arXiv cs.CL ↗