Проблема «слепых зон» в пайплайнах
Использование мощных моделей (например, Claude Opus) в роли мета-агентов для генерации задач и верификаторов стало стандартом в обучении терминальных агентов методом RL. Однако команда исследователей во главе с Xi Qin (arXiv:2610.02405) доказала, что наличие исполняемого Docker-образа и набора тестов не гарантирует корректности всего конвейера. Они выделили три критические категории сбоев:
- Invalidity of benchmark (невалидность бенчмарка): задачи могут быть нерешаемыми или содержать логические ошибки.
- Harness brittleness (хрупкость инфраструктуры): тестовые стенды ломаются от неочевидных edge-case сценариев.
- Reward misalignment (рассинхронизация вознаграждения): метрики успеха не совпадают с реальными целями агента.
Эксперимент: от 5.6x улучшения к «стеклянному потолку»
Исследователи провели серию экспериментов, оптимизируя промпты и расширяя контекст. Это позволило повысить базовую решаемость задач в 5.6 раза. Однако при обучении модели на 9 миллиардов параметров (9B) был достигнут предел: mean pass@2 составил 81.3% в течение 20 шагов обучения на задачах, сгенерированных Claude Opus.
Самый важный вывод был сделан при добавлении «сложных» (hard) задач. При неизменной конфигурации обучения средний показатель pass@2 рухнул до 20.6%. Это доказывает, что диапазон решаемости (solvability band) строго специфичен для архитектуры модели, и универсальные датасеты не работают.
Сравнение метрик решаемости
| Условие эксперимента | Метрика (mean pass@2) | Интерпретация |
|---|---|---|
| Базовая оптимизация (промпты + контекст) | Улучшение в 5.6 раз (относительно исходника) | Качество данных критично, но недостаточно |
| Модель 9B на задачах Claude Opus (20 шагов) | 81.3% | Достигнут предел обучаемости на текущем датасете |
| Добавление Hard-задач (без смены конфига) | 20.6% | Резкий спад подтверждает узкую «полосу решаемости» модели |
Новый стандарт оценки
Авторы настаивают на том, что надежность мета-агентов должна оцениваться не постфактум, а через призму трех новых критериев:
- Solvability-band calibration — калибровка диапазона решаемости под конкретную модель.
- Verifier audits — глубокий аудит верификаторов на предмет ложных срабатываний.
- Infrastructure error accounting — учет ошибок инфраструктуры как первоклассной метрики качества данных.
Исследование ставит под сомнение слепое доверие к автоматической генерации данных и требует более строгого контроля на этапе создания обучающих выборок.
Источник: arXiv cs.AI ↗
