Исследования7 августа 2026 г., 10:17 МСК🤖 Auto

SMRC-SD: Как выровнять обучение мульти-шаговых AI-агентов

Исследователи представили метод SMRC-SD, решающий проблему рассинхронизации состояний при обучении AI-агентов. Метод повышает успешность задач на 12-19% за счет точечной дистилляции знаний.

Баннер новости 5282

Проблема: когда учитель «не видит» ученика

В обучении мульти-шаговых агентов (multi-turn agents) часто используется привилегированная дистилляция on-policy. Идея проста: синхронизированный «учитель» оценивает ответы «ученика», опираясь на эталонные успешные траектории. Однако в интерактивных средах каждое действие ученика меняет состояние среды. Если ученик совершает действия в ином порядке или достигает подцелей иначе, его текущее состояние может отсутствовать в эталонной траектории. Это создает рассинхронизацию состояний (state-reference mismatch): учитель пытается дать совет по ситуации, которой фактически нет у ученика, что снижает эффективность обучения.

Решение: SMRC-SD

Авторы (Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang) предложили метод State-Matched Routing and Contextualized Self-Distillation (SMRC-SD). Его суть в двух этапах на каждом шаге взаимодействия:

  • State-Matched Routing: Система проверяет, совпадает ли текущее состояние ученика с поддерживаемым состоянием в эталонной траектории. Дистилляция применяется только к совпадающим состояниям, игнорируя «чужие» шаги.
  • Contextualized Self-Distillation: Для каждого совпавшего состояния формируется контекст учителя, conditioned на фактическое состояние ученика. Это гарантирует, что наставление релевантно текущей ситуации.

Результаты: рост эффективности

Метод протестирован на двух сложных benchmarks: ALFWorld (взаимодействие с объектами в виртуальной среде) и WebShop (поиск и покупка товаров). Использовалась модель Qwen3-1.7B. SMRC-SD стабильно превосходит безусловную дистилляцию полного пути (unconditional successful full-path distillation).

Среда (Benchmark) Базовая модель (Qwen3-1.7B) SMRC-SD Прирост
ALFWorld 0.746 0.865 +15.9%
WebShop 0.574 0.693 +20.7%

Абляционные исследования подтвердили, что именно выбор локально поддерживаемых шагов и построение совместимого контекста вносят основной вклад в улучшение результатов. Код метода доступен в репозитории авторов.

Источник: arXiv cs.AI ↗