Проблема статичных сценариев
Современные ролевые агенты на базе LLM часто обучаются на фиксированных пулах сценариев, собранных до начала обучения. Это создает распределительный бутылочное горлышко: по мере улучшения агента, зоны его слабостей смещаются, но обучающая выборка остается неизменной. В результате модель перестает учиться на новых, более сложных вызовах.
Решение: AdvRole и замкнутый цикл
Команда авторов (Чжэн Чжан, Лю Лю и др.) предложила AdvRole — framework adversarial context rewriting. Система работает как замкнутый цикл (closed-loop curriculum), чередуя два процесса:
- Actor (Агент): учится отыгрывать роль.
- Rewriter (Переписыватель): редактирует профили персонажей и контексты диалогов, превращая их в «хардкорные» сценарии, специфичные для текущих слабостей Агента.
Ключевой механизм — reward по разнице производительности (performance-gap reward). Переписыватель получает бонус, если его изменения снижают оценку Агента по сравнению с оригинальным сценарием. Это заставляет систему постоянно атаковать уязвимые места модели.
Результаты и бенчмарки
Эксперименты проводились на трех ролевых бенчмарках (английский и китайский языки) и новом мультиязычном датасете, опубликованном авторами. AdvRole стабильно превосходит базовые модели (baselines), демонстрируя способность адаптироваться к эволюционирующим сложностям.
| Компонент | Роль в системе | Механизм обучения |
|---|---|---|
| Actor | Отыгрывает роль | RL-оптимизация |
| Rewriter | Генерирует сложные сценарии | Maximize performance gap (снижение счета Actor) |
| Curriculum | Динамическая сложность | Замкнутый цикл (Closed-loop) |
Значение для индустрии
Подход решает фундаментальную проблему генерации данных для обучения: вместо ручного сбора сценариев, система сама генерирует «наиболее полезные» для обучения примеры. Это открывает путь к созданию более устойчивых и интеллектуальных персонажей для симуляций и персонализированных ассистентов.
Источник: arXiv cs.AI ↗
