Проблема: когда учитель «не видит» ученика
В обучении мульти-шаговых агентов (multi-turn agents) часто используется привилегированная дистилляция on-policy. Идея проста: синхронизированный «учитель» оценивает ответы «ученика», опираясь на эталонные успешные траектории. Однако в интерактивных средах каждое действие ученика меняет состояние среды. Если ученик совершает действия в ином порядке или достигает подцелей иначе, его текущее состояние может отсутствовать в эталонной траектории. Это создает рассинхронизацию состояний (state-reference mismatch): учитель пытается дать совет по ситуации, которой фактически нет у ученика, что снижает эффективность обучения.
Решение: SMRC-SD
Авторы (Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang) предложили метод State-Matched Routing and Contextualized Self-Distillation (SMRC-SD). Его суть в двух этапах на каждом шаге взаимодействия:
- State-Matched Routing: Система проверяет, совпадает ли текущее состояние ученика с поддерживаемым состоянием в эталонной траектории. Дистилляция применяется только к совпадающим состояниям, игнорируя «чужие» шаги.
- Contextualized Self-Distillation: Для каждого совпавшего состояния формируется контекст учителя, conditioned на фактическое состояние ученика. Это гарантирует, что наставление релевантно текущей ситуации.
Результаты: рост эффективности
Метод протестирован на двух сложных benchmarks: ALFWorld (взаимодействие с объектами в виртуальной среде) и WebShop (поиск и покупка товаров). Использовалась модель Qwen3-1.7B. SMRC-SD стабильно превосходит безусловную дистилляцию полного пути (unconditional successful full-path distillation).
| Среда (Benchmark) | Базовая модель (Qwen3-1.7B) | SMRC-SD | Прирост |
|---|---|---|---|
| ALFWorld | 0.746 | 0.865 | +15.9% |
| WebShop | 0.574 | 0.693 | +20.7% |
Абляционные исследования подтвердили, что именно выбор локально поддерживаемых шагов и построение совместимого контекста вносят основной вклад в улучшение результатов. Код метода доступен в репозитории авторов.
Источник: arXiv cs.AI ↗
