Скрытая переменная в оценке AI-агентов
Публичные лидерборды для coding-агентов (таких как Terminal-Bench Pro) часто ранжируют системы исключительно по названию модели и проценту успешных решений (pass rate). Однако исследователи Naman Vats и Oleg Golev из работы "The Scaffold Effect in Coding Agents" (arXiv:2607.22585) доказывают, что это вводит в заблуждение. Ключевым фактором, определяющим эффективность, является «подложка» (harness) — система, которая управляет контекстом, выдает инструменты и решает, когда остановить выполнение.
Когда harness меняется, производительность и эффективность смешиваются: невозможно понять, улучшилась ли модель или просто изменилась среда её работы. Авторы провели стратифицированное тестирование на 50 задачах из Terminal-Bench Pro, сравнивая две передовые модели — Qwen 3.6 Plus и MiniMax M2.5 — в трех разных open-source фреймворках: Goose, OpenCode и OpenHands-SDK.
40-кратная разница в стоимости
Результаты эксперимента выявили шокирующую дисперсию в эффективности. Выбор фреймворка влиял на количество токенов, необходимых для решения одной задачи, в 40 раз. При этом разница в качестве кода (pass rate) между моделями внутри одного фреймворка оставалась минимальной — от 0 до 8 процентных пунктов, причем в большинстве случаев статистически значимой разницы не было (95% доверительный интервал включал ноль).
| Метрика / Параметр | Наблюдение | Значение для бизнеса |
|---|---|---|
| Разница в токенах | До 40x между разными harness | Критическое влияние на стоимость API-запросов |
| Разница в Pass Rate | 0–8% (внутри модели) | Качество кода слабо зависит от выбора фреймворка |
| Типичные ошибки | REASON (Goose), VERIFY/MAX_TURNS (OpenHands), idle-loop (OpenCode) | Ошибки системные, а не модельные |
| «Налог на ожидание» | No-action turns | Задержки (latency) важнее стоимости токенов |
Отпечатки неудач (Failure Fingerprints)
Исследование выявило, что характерные ошибки реплицируются между разными моделями внутри одного фреймворка. Это подтверждает гипотезу о том, что проблемы кроются в архитектуре подложки, а не в интеллекте LLM. Например:
- Goose: агенты часто застревали в циклах рассуждений (REASON).
- OpenHands-SDK: проблемы с верификацией и превышением лимита шагов (VERIFY/MAX_TURNS).
- OpenCode: простои и таймауты (idle-loop/TIME).
Почему это важно для разработчиков
Авторы приходят к выводу, что для оценки coding-агентов в реальных условиях название модели — недостаточная единица сравнения. Реальная стоимость, задержка (latency) и нагрузка на контроль человека определяются парой harness-model. Особое внимание уделяется «нулевым ходам» (no-action turns): это не просто расход токенов, а прямой налог на время ожидания пользователя.
Рекомендация исследователей: выбирать связку фреймворка и модели не только по проценту успешных решений, но и с учетом бюджетов на токены и задержки. При публикации результатов необходимо обязательно указывать спецификации harness, использование токенов и латентность, а не только pass rate.
Источник: arXiv cs.AI ↗
