Исследования14 сентября 2026 г., 13:18 МСК🤖 Auto

RMDM: Как глобальная семантика решает проблему параллельной генерации текста

Исследователи представили RMDM — модель, использующую латентные представления для координации параллельного обновления токенов, что резко повышает качество генерации при минимальном числе шагов.

Баннер новости 7442

Проблема изолированного обновления токенов

Masked Diffusion Models (MDM) обещают эффективную параллельную генерацию текста, но существующие методы обновления маскированных токенов часто работают независимо друг от друга. Это игнорирует сложные взаимозависимости между токенами, что приводит к отсутствию глобальной координации и, как следствие, к невязким (incoherent) выводам модели.

Решение: Representation-based Masked Diffusion Model (RMDM)

Авторы (Yangrong Hu, Ding Huang, Xueyu Zhou, Jian Huang) предлагают фреймворк RMDM, который использует непрерывное семантическое пространство для явного кодирования глобальной семантики. Ключевые технические шаги:

  • Кодирование: Текст преобразуется в непрерывное семантическое пространство с помощью предварительно обученного энкодера.
  • Нормализация: Обучается обратимое преобразование, нормализующее распределение представлений до гауссовского априорного распределения, что ускоряет сэмплинг.
  • Координация: Масштабированная диффузионная модель обучается на условном распределении текста, где латентное представление служит глобальной семантической направляющей для согласованного параллельного обновления токенов.

Результаты: Качество при агрессивном сэмплинге

Эмпирические результаты показывают, что RMDM значительно улучшает качество генерации, особенно в режимах агрессивного сэмплинга с малым числом шагов (few-step sampling). Это критически важно для снижения вычислительных затрат при сохранении связности текста.

Характеристика Стандартные MDM RMDM (предлагаемая модель)
Механизм обновления Независимое обновление токенов Координированное через глобальную семантику
Глобальная координация Отсутствует/Слабая Явное кодирование через латентные представления
Качество при few-step Снижается Значительно улучшено
Сложность сэмплинга Выше (из-за итеративности) Ниже (благодаря нормализации в гауссовское пространство)

Значение для индустрии

Работа демонстрирует путь к более эффективным языковым моделям, способным генерировать связный текст за несколько шагов. Это открывает возможности для развертывания диффузионных моделей в условиях ограниченных вычислительных ресурсов, где скорость генерации так же важна, как и её качество.

Источник: arXiv cs.CL ↗