Проблема авторегрессионных моделей
С развитием обучения с подкреплением (RL) возникла острая потребность в разнообразных средах. Авторегрессионные (AR) языковые модели, используемые как модели мира, страдают от «левостороннего смещения» (left-to-right bias). Это мешает им учитывать глобально зависимые якоря состояния, такие как схемы инструментов, предыдущие ходы и ожидаемые результаты, что приводит к коллапсу мод и неэффективности при длинных горизонтах планирования.
Решение: Masked Diffusion Language Models
Авторы предлагают использовать MDLM, которые благодаря двунаправленному шумоподавлению, aware к якорям, обеспечивают лучшую связность и обоснованность. Исследование формализует текстовое моделирование мира как управляемую задачу динамики переходов, включающую начальное состояние, контекст задачи, правила домена и директивы управления.
Масштаб данных и бенчмарки
Для обучения и тестирования был собран датасет из 239 403 заземленных траекторий «состояние-действие». Данные охватывают 9 открытых сред и 12 семейств передовых моделей. Сравнение проводилось на бэкбонах LFM2.5, Qwen3 и Mistral (размером от 1.2B до 7B параметров).
Ключевые метрики и результаты
MDLM демонстрируют эмпирически подтвержденное разнообразие выкатки (rollout diversity), превосходя LLM размером в 4 раза больше, при сопоставимой скорости инференса. Внедрение плагина GRPO с детерминированными проверками состояний позволило достичь значительных улучшений при zero-shot переносе на три среды OOD (ScienceWorld, ALFWorld, AppWorld).
| Метрика / Параметр | Результат / Значение |
|---|---|
| Размер датасета | 239 403 траекторий |
| Количество сред | 9 открытых + 3 OOD (ScienceWorld, ALFWorld, AppWorld) |
| Семейства моделей | 12 (включая LFM2.5, Qwen3, Mistral) |
| Размер бэкбонов | 1.2B – 7B параметров |
| Прирост точности (Zero-shot) | До +47% абсолютного улучшения над базовыми линиями |
| Скорость инференса | Сопоставима с AR-моделями |
Значение для индустрии
Работа открывает путь к созданию масштабируемых, управляемых симуляторов для обучения агентов без необходимости тонкой настройки под каждую конкретную среду. Код и датасет опубликованы для стимулирования дальнейших исследований в области агентного RL.
Источник: arXiv cs.AI ↗
