Исследования1 октября 2026 г., 09:17 МСК🤖 Auto

GFlowNets решают проблему mode collapse в синтетических диалогах

Исследователи представили метод генерации разнообразных экспертных диалогов через GFlowNets, превосходящий RL и прямое промптирование LLM по охвату режимов и аутентичности.

Баннер новости 8670

Проблема: Mode Collapse в синтетических данных

Качественные синтетические данные критически важны для пост-обучения (post-training) больших языковых моделей (LLM), особенно в задачах, требующих адаптации к разнообразным экспертным стратегиям. Однако традиционные методы — прямое промптирование LLM или условная генерация на основе сценариев использования — приводят к mode collapse (схлопыванию режимов). Данные «схлопываются» к доминирующим паттернам, теряя вариативность и репрезентативность реальных взаимодействий.

Решение: GFlowNets и гауссовская смесь

Авторы (Sumit Asthana, Michael Ion, Kevyn Collins Thompson) предлагают использовать Generative Flow Networks (GFlowNets) для генерации латентной структуры диалога. Ключевая инновация — обучение GFlowNets через гауссовскую смесь плотностей (Gaussian mixture density) по ключевым признакам взаимодействия. Это позволяет выбирать экспертные стратегии пропорционально их распространенности в обучающих данных, избегая копирования исходных текстов.

Экспериментальные домены и метрики

Метод протестирован в двух структурно различных областях:

  • Репетиторство (Tutoring): динамика эпизодов путаницы (confusion episode dynamics).
  • Эмоциональная поддержка (Emotional Support): баланс директив по поддержке (scaffolding directive balance).

Результаты оценивались на трех задачах прогнозирования исходов (downstream outcome prediction tasks). Классификаторы, обученные на синтетических данных GFlowNet, получили более сильный обучающий сигнал по сравнению с базовыми методами синтеза.

Сравнение с базовыми моделями

Подход GFlowNet демонстрирует лучший баланс между верностью (fidelity), охватом режимов (mode coverage) и аутентичностью, чем методы на основе обучения с подкреплением (RL) и end-to-end LLM.

Метрика / Аспект GFlowNets (Proposed) RL Baselines End-to-End LLM
Разнообразие (Mode Coverage) Высокое (пропорциональное) Склонность к коллапсу Низкое (схлопывание)
Аутентичность Высокая Средняя Средняя/Низкая
Качество сигнала для downstream-задач Лучший результат Уступает Уступает
Копирование данных Отсутствует Возможно Возможно

Работа опубликована 29 сентября 2026 года в arXiv (cs.AI, cs.CL, cs.LG).

Источник: arXiv cs.AI ↗