Суть эксперимента: Qwen3-8B против 4 сред
Команда исследователей во главе с Чэньцянем Ле провела строгий контроль переменных, обучая модель Qwen3-8B (супервизорный старт) на одних и тех же записях задач. Ключевое отличие заключалось в том, какие harness (оболочки исполнения) использовались для генерации наград:
- Aider
- OpenHands
- Qwen Code
- SWE-agent
Модель обучалась по алгоритму GRPO (Group-Relative Policy Optimization) в двух режимах распределения кредита: Within (сравнение внутри пары задача-harness) и Cross (сравнение между разными harness для одной задачи). Проверка проводилась на SWE-bench Verified с использованием «запечатанного» оракула.
Главный вывод: Harness — доминирующий фактор
Результаты 24 000 проверок показали шокирующую диспропорцию. Выбор среды исполнения (harness) изменил средний процент решенных задач с 2.14% до 9.27% (фактор 4.3). В то же время выбор алгоритма обучения (рецепта) повлиял на результат лишь в 1.16 раза.
Разница между режимами Within и Cross оказалась статистически незначимой. На выделенной среде (held-out harness) преимущество Cross над Within составило всего +0.25 процентных пункта, что укладывается в доверительный интервал [-0.48, +1.02].
Адаптация, а не портативность
Исследователи проверили, учит ли модель общие навыки программирования или просто «привыкает» к синтаксису конкретного агента. Классификатор, пытавшийся определить, из какой среды получен выигрыш, успешно восстанавливал источник с точностью +4.48 pp выше базового уровня. Это доказывает, что модель не учит переносимые способности, а подстраивается под конфигурацию конкретного harness.
Данные сравнения режимов обучения
| Метрика / Режим | Within (Внутри пары) | Cross (Между harness) | Значимость |
|---|---|---|---|
| Влияние на solve rate (фактор) | 1.16x | 1.16x | Одинаковое |
| Разница на held-out harness | База | +0.25 pp | Незначимо (CI: -0.48, +1.02) |
| Влияние выбора Harness | Фактор 4.3 (2.14% → 9.27%) | Доминирующий фактор | |
| Распределение действий | Идентично | Идентично | Нет переноса навыков |
Почему это важно для индустрии
Статья бьет по популярному тренду на использование сложных мульти-агентных систем. Авторы призывают:
- Всегда указывать границу группировки (grouping boundary) в отчетах о RL.
- Тестировать модели на невидимых во время обучения harness, чтобы отличить реальное улучшение кодинга от переобучения под интерфейс конкретного агента.
Пересборка половины данных on-policy не изменила картину, подтверждая, что проблема в архитектуре сравнения наград, а не в сборе данных.
Источник: arXiv cs.AI ↗
