Проблема: «Поведение» размазано по коду
Современный AI-агент — это не только фундаментальная модель. Его «хarness» (обвязка) управляет состоянием, вызывает инструменты и координирует выполнение задач. По мере эволюции моделей и API этот код становится огромным, tightly coupled (жестко связанным) и фрагментированным. Главная боль разработчиков и coding-агентов: запрос на изменение описывает что должна делать система, но не указывает, где в репозитории искать нужный фрагмент кода. Традиционный поиск по коду и индексация не решают проблему маппинга «поведение → код».
Решение: Behavior-Centric Representation
Команда авторов (Ruhan Wang, Yucheng Shi и др.) предлагает Harness Handbook — автоматически синтезируемое представление, основанное на анализе поведения, а не файлов. Система использует статический анализ и LLM для связывания каждого описанного поведения с конкретными исходными файлами. Ключевой механизм — Behavior-Guided Progressive Disclosure (BGPD): он направляет агента от высокоуровневых задач к деталям реализации, верифицируя кандидаты на месте.
Результаты: Эффективность планирования
Эксперименты на двух открытых harness-системах показали, что использование Handbook-ассистированного планирования значительно улучшает качество плана редактирования. Особенно заметен прирост в сложных сценариях: разрозненные участки кода, редко выполняемые пути и кросс-модульные взаимодействия. При этом система требует меньше токенов для планирования.
| Метрика / Сценарий | Результат применения Harness Handbook |
|---|---|
| Качество плана редактирования | Значительное улучшение (улучшена локализация поведения) |
| Затраты на планирование | Снижение количества используемых токенов |
| Сложные сценарии | Наибольший прирост эффективности на разрозненных сайтах и кросс-модульных взаимодействиях |
| Основной вклад | Решение проблемы «где менять», а не только «как менять» |
Почему это важно
Эволюция сложных агентов зависит не только от генерации правок, но и от точного определения места их внесения. Harness Handbook закрывает критический узкий горлышко (bottleneck) в разработке AI-систем, делая их код читаемым, навигируемым и редактируемым для самих агентов.
Источник: arXiv cs.AI ↗
