Исследования7 сентября 2026 г., 12:21 МСК🤖 Auto

Мульти-хэрнес RL: почему среда важнее алгоритма в кодинге

Исследование arXiv:2609.04518 доказывает, что выбор среды исполнения (harness) влияет на успех агента в 4.3 раза сильнее, чем метод обучения с подкреплением. Алгоритмы не учат переносимые навыки, а адаптируются под конкретный интерфейс.

Баннер новости 6925

Суть эксперимента: Qwen3-8B против 4 сред

Команда исследователей во главе с Чэньцянем Ле провела строгий контроль переменных, обучая модель Qwen3-8B (супервизорный старт) на одних и тех же записях задач. Ключевое отличие заключалось в том, какие harness (оболочки исполнения) использовались для генерации наград:

  • Aider
  • OpenHands
  • Qwen Code
  • SWE-agent

Модель обучалась по алгоритму GRPO (Group-Relative Policy Optimization) в двух режимах распределения кредита: Within (сравнение внутри пары задача-harness) и Cross (сравнение между разными harness для одной задачи). Проверка проводилась на SWE-bench Verified с использованием «запечатанного» оракула.

Главный вывод: Harness — доминирующий фактор

Результаты 24 000 проверок показали шокирующую диспропорцию. Выбор среды исполнения (harness) изменил средний процент решенных задач с 2.14% до 9.27% (фактор 4.3). В то же время выбор алгоритма обучения (рецепта) повлиял на результат лишь в 1.16 раза.

Разница между режимами Within и Cross оказалась статистически незначимой. На выделенной среде (held-out harness) преимущество Cross над Within составило всего +0.25 процентных пункта, что укладывается в доверительный интервал [-0.48, +1.02].

Адаптация, а не портативность

Исследователи проверили, учит ли модель общие навыки программирования или просто «привыкает» к синтаксису конкретного агента. Классификатор, пытавшийся определить, из какой среды получен выигрыш, успешно восстанавливал источник с точностью +4.48 pp выше базового уровня. Это доказывает, что модель не учит переносимые способности, а подстраивается под конфигурацию конкретного harness.

Данные сравнения режимов обучения

Метрика / Режим Within (Внутри пары) Cross (Между harness) Значимость
Влияние на solve rate (фактор) 1.16x 1.16x Одинаковое
Разница на held-out harness База +0.25 pp Незначимо (CI: -0.48, +1.02)
Влияние выбора Harness Фактор 4.3 (2.14% → 9.27%) Доминирующий фактор
Распределение действий Идентично Идентично Нет переноса навыков

Почему это важно для индустрии

Статья бьет по популярному тренду на использование сложных мульти-агентных систем. Авторы призывают:

  1. Всегда указывать границу группировки (grouping boundary) в отчетах о RL.
  2. Тестировать модели на невидимых во время обучения harness, чтобы отличить реальное улучшение кодинга от переобучения под интерфейс конкретного агента.

Пересборка половины данных on-policy не изменила картину, подтверждая, что проблема в архитектуре сравнения наград, а не в сборе данных.

Источник: arXiv cs.AI ↗