Исследования21 июля 2026 г., 09:16 МСК🤖 Auto

MDLM: Диффузионные языковые модели бьют AR-LLM в ролевых играх

Исследователь Darshan Deshpande представил Masked Diffusion Language Models (MDLM) как эффективные текстовые модели мира для агентов RL, превосходящие авторегрессионные аналоги в 4 раза по параметрам.

Баннер новости 4013

Проблема авторегрессионных моделей

С развитием обучения с подкреплением (RL) возникла острая потребность в разнообразных средах. Авторегрессионные (AR) языковые модели, используемые как модели мира, страдают от «левостороннего смещения» (left-to-right bias). Это мешает им учитывать глобально зависимые якоря состояния, такие как схемы инструментов, предыдущие ходы и ожидаемые результаты, что приводит к коллапсу мод и неэффективности при длинных горизонтах планирования.

Решение: Masked Diffusion Language Models

Авторы предлагают использовать MDLM, которые благодаря двунаправленному шумоподавлению, aware к якорям, обеспечивают лучшую связность и обоснованность. Исследование формализует текстовое моделирование мира как управляемую задачу динамики переходов, включающую начальное состояние, контекст задачи, правила домена и директивы управления.

Масштаб данных и бенчмарки

Для обучения и тестирования был собран датасет из 239 403 заземленных траекторий «состояние-действие». Данные охватывают 9 открытых сред и 12 семейств передовых моделей. Сравнение проводилось на бэкбонах LFM2.5, Qwen3 и Mistral (размером от 1.2B до 7B параметров).

Ключевые метрики и результаты

MDLM демонстрируют эмпирически подтвержденное разнообразие выкатки (rollout diversity), превосходя LLM размером в 4 раза больше, при сопоставимой скорости инференса. Внедрение плагина GRPO с детерминированными проверками состояний позволило достичь значительных улучшений при zero-shot переносе на три среды OOD (ScienceWorld, ALFWorld, AppWorld).

Метрика / ПараметрРезультат / Значение
Размер датасета239 403 траекторий
Количество сред9 открытых + 3 OOD (ScienceWorld, ALFWorld, AppWorld)
Семейства моделей12 (включая LFM2.5, Qwen3, Mistral)
Размер бэкбонов1.2B – 7B параметров
Прирост точности (Zero-shot)До +47% абсолютного улучшения над базовыми линиями
Скорость инференсаСопоставима с AR-моделями

Значение для индустрии

Работа открывает путь к созданию масштабируемых, управляемых симуляторов для обучения агентов без необходимости тонкой настройки под каждую конкретную среду. Код и датасет опубликованы для стимулирования дальнейших исследований в области агентного RL.

Источник: arXiv cs.AI ↗