Исследования29 июля 2026 г., 06:16 МСК🤖 Auto

Эффект подложки: почему выбор фреймворка важнее модели в AI-кодинге

Исследование показывает, что выбор «подложки» (harness) для AI-агентов влияет на стоимость и скорость решения задач сильнее, чем сама модель. Разница в потреблении токенов достигает 40 раз.

Баннер новости 4598

Скрытая переменная в оценке AI-агентов

Публичные лидерборды для coding-агентов (таких как Terminal-Bench Pro) часто ранжируют системы исключительно по названию модели и проценту успешных решений (pass rate). Однако исследователи Naman Vats и Oleg Golev из работы "The Scaffold Effect in Coding Agents" (arXiv:2607.22585) доказывают, что это вводит в заблуждение. Ключевым фактором, определяющим эффективность, является «подложка» (harness) — система, которая управляет контекстом, выдает инструменты и решает, когда остановить выполнение.

Когда harness меняется, производительность и эффективность смешиваются: невозможно понять, улучшилась ли модель или просто изменилась среда её работы. Авторы провели стратифицированное тестирование на 50 задачах из Terminal-Bench Pro, сравнивая две передовые модели — Qwen 3.6 Plus и MiniMax M2.5 — в трех разных open-source фреймворках: Goose, OpenCode и OpenHands-SDK.

40-кратная разница в стоимости

Результаты эксперимента выявили шокирующую дисперсию в эффективности. Выбор фреймворка влиял на количество токенов, необходимых для решения одной задачи, в 40 раз. При этом разница в качестве кода (pass rate) между моделями внутри одного фреймворка оставалась минимальной — от 0 до 8 процентных пунктов, причем в большинстве случаев статистически значимой разницы не было (95% доверительный интервал включал ноль).

Метрика / Параметр Наблюдение Значение для бизнеса
Разница в токенах До 40x между разными harness Критическое влияние на стоимость API-запросов
Разница в Pass Rate 0–8% (внутри модели) Качество кода слабо зависит от выбора фреймворка
Типичные ошибки REASON (Goose), VERIFY/MAX_TURNS (OpenHands), idle-loop (OpenCode) Ошибки системные, а не модельные
«Налог на ожидание» No-action turns Задержки (latency) важнее стоимости токенов

Отпечатки неудач (Failure Fingerprints)

Исследование выявило, что характерные ошибки реплицируются между разными моделями внутри одного фреймворка. Это подтверждает гипотезу о том, что проблемы кроются в архитектуре подложки, а не в интеллекте LLM. Например:

  • Goose: агенты часто застревали в циклах рассуждений (REASON).
  • OpenHands-SDK: проблемы с верификацией и превышением лимита шагов (VERIFY/MAX_TURNS).
  • OpenCode: простои и таймауты (idle-loop/TIME).

Почему это важно для разработчиков

Авторы приходят к выводу, что для оценки coding-агентов в реальных условиях название модели — недостаточная единица сравнения. Реальная стоимость, задержка (latency) и нагрузка на контроль человека определяются парой harness-model. Особое внимание уделяется «нулевым ходам» (no-action turns): это не просто расход токенов, а прямой налог на время ожидания пользователя.

Рекомендация исследователей: выбирать связку фреймворка и модели не только по проценту успешных решений, но и с учетом бюджетов на токены и задержки. При публикации результатов необходимо обязательно указывать спецификации harness, использование токенов и латентность, а не только pass rate.

Источник: arXiv cs.AI ↗