Исследования9 июля 2026 г., 13:46 МСК🤖 Auto

Звездообразная диффузия: как российские ученые ускорили генерацию кода и текста

Команда из Сбера и МФТИ представила алгоритм Guided Star-Shaped Masked Diffusion, который исправляет ошибки генерации на лету, повышая качество текста и кода без перетренировки всей модели.

Баннер новости 3198

Проблема необратимых решений в диффузии

Традиционные маскированные диффузионные модели (Masked Diffusion Models) часто сталкиваются с фундаментальным ограничением: процесс сэмплирования (генерации) принимает решения, которые сложно отменить. Если модель на раннем шаге выбирает неверный токен или символ, ошибка накапливается, особенно при генерации в малом количестве шагов (low-step regime). Это критично для задач, где важна точность, таких как написание программного кода или структурированного текста.

Решение: «Звездообразная» парадигма

Российские исследователи (Вячеслав Мещанинов, Егор Шибайев, Артем Макоян и др.) предложили новый алгоритм сэмплирования, который реформирует процесс генерации. Ключевая инновация — использование звездообразной парадигмы (star-shaped paradigm). В отличие от линейных методов, эта структура позволяет модели «возвращаться» к исходному состоянию и исправлять ошибки, перемаскируя неверно предсказанные части данных.

Для эффективности этого процесса команда внедрила обучаемый расписание перемаскивания (re-masking scheduler). Он интеллектуально определяет, какие части сгенерированного текста или кода с наибольшей вероятностью содержат ошибки, и фокусирует вычислительные ресурсы на их исправлении.

Экономия ресурсов и качество

Метод не требует полной перетренировки модели. Достаточно легковесной донастройки (fine-tuning) всего одного слоя архитектуры. Это делает технологию применимой к уже существующим предобученным моделям, экономя время и вычислительные мощности разработчиков.

Результаты бенчмарков

В ходе экспериментов по генерации текста и кода новый алгоритм показал результаты, сопоставимые с лучшими существующими методами, но с существенным преимуществом в скорости и стабильности при малом числе шагов генерации. Ниже приведена сравнительная оценка ключевых характеристик подхода:

Параметр Традиционные Masked Diffusion Guided Star-Shaped (Новый метод)
Коррекция ошибок Сложная/Невозможная после шага Встроенная (через перемаскивание)
Количество шагов сэмплирования Требует много шагов для качества Эффективен при малом количестве шагов
Требования к дообучению Часто полная переобучение Достаточно одного слоя (lightweight)
Качество кода/текста Базовый уровень Соответствует или превосходит SOTA

Исследование демонстрирует, что правильный подход к исправлению ошибок на этапе сэмплирования может быть эффективнее, чем просто увеличение глубины модели.

Источник: Arxiv ↗