Исследования5 октября 2026 г., 11:18 МСК🤖 Auto

Почему RL-тренировка терминальных агентов буксует: разбор ошибок генерации данных

Исследование показывает, что наличие Docker-образа и тестов не гарантирует успешного обучения агентов. Авторы выявили три класса сбоев и доказали, что «полоса решаемости» задач специфична для каждой модели.

Баннер новости 8932

Проблема «слепых зон» в пайплайнах

Использование мощных моделей (например, Claude Opus) в роли мета-агентов для генерации задач и верификаторов стало стандартом в обучении терминальных агентов методом RL. Однако команда исследователей во главе с Xi Qin (arXiv:2610.02405) доказала, что наличие исполняемого Docker-образа и набора тестов не гарантирует корректности всего конвейера. Они выделили три критические категории сбоев:

  • Invalidity of benchmark (невалидность бенчмарка): задачи могут быть нерешаемыми или содержать логические ошибки.
  • Harness brittleness (хрупкость инфраструктуры): тестовые стенды ломаются от неочевидных edge-case сценариев.
  • Reward misalignment (рассинхронизация вознаграждения): метрики успеха не совпадают с реальными целями агента.

Эксперимент: от 5.6x улучшения к «стеклянному потолку»

Исследователи провели серию экспериментов, оптимизируя промпты и расширяя контекст. Это позволило повысить базовую решаемость задач в 5.6 раза. Однако при обучении модели на 9 миллиардов параметров (9B) был достигнут предел: mean pass@2 составил 81.3% в течение 20 шагов обучения на задачах, сгенерированных Claude Opus.

Самый важный вывод был сделан при добавлении «сложных» (hard) задач. При неизменной конфигурации обучения средний показатель pass@2 рухнул до 20.6%. Это доказывает, что диапазон решаемости (solvability band) строго специфичен для архитектуры модели, и универсальные датасеты не работают.

Сравнение метрик решаемости

Условие эксперимента Метрика (mean pass@2) Интерпретация
Базовая оптимизация (промпты + контекст) Улучшение в 5.6 раз (относительно исходника) Качество данных критично, но недостаточно
Модель 9B на задачах Claude Opus (20 шагов) 81.3% Достигнут предел обучаемости на текущем датасете
Добавление Hard-задач (без смены конфига) 20.6% Резкий спад подтверждает узкую «полосу решаемости» модели

Новый стандарт оценки

Авторы настаивают на том, что надежность мета-агентов должна оцениваться не постфактум, а через призму трех новых критериев:

  1. Solvability-band calibration — калибровка диапазона решаемости под конкретную модель.
  2. Verifier audits — глубокий аудит верификаторов на предмет ложных срабатываний.
  3. Infrastructure error accounting — учет ошибок инфраструктуры как первоклассной метрики качества данных.

Исследование ставит под сомнение слепое доверие к автоматической генерации данных и требует более строгого контроля на этапе создания обучающих выборок.

Источник: arXiv cs.AI ↗