Проблема «двойной оплаты» за поиск
Основная причина перерасхода токенов в кодинг-агентах — не создание кода, а его поиск. Исследователи из JetBrains выявили, что агент платит дважды за каждый неуклюжий запрос: один раз за сам шаг поиска, и второй раз — каждый раз, когда растущий контекст диалога перечитывается моделью. Навык Benjamin Plus решает эту проблему, обучая агента пяти ключевым привычкам:
- Разведка в один проход: Сбор фактов происходит единым шагом, а не серией из пяти запросов к репозиторию. Перед копированием формата проверяются два примера, а не один.
- Чтение через «замочную скважину»: Агент читает только нужные 50 строк файла, а не весь документ целиком. Данные, которые будут трансформироваться, никогда не обрезаются.
- Однократная проверка окружения: Все зависимости проверяются одной командой, а не методом последовательных сбоев.
- «Зеленый» как критерий успеха: Если задача содержит команду проверки, её успешное выполнение — это конец работы. Два провала проверки означают ошибку подхода, а не симптома.
- Опрос как шаг: Проверка сборки происходит каждые 30 секунд, а не каждую секунду. На некоторых платформах это сокращает количество шагов почти вдвое.
Результаты бенчмарков: цифры и статистика
Оптимизация была разработана методом авто-исследований (auto research): агент анализировал ~1200 старых трасс, создавал правила, проводил A/B-тесты и отбрасывал те, что снижали качество. Итоговая версия (v6) была протестирована на различных платформах. Ключевые метрики эффективности приведены в таблице ниже:
| Платформа / Модель | Снижение стоимости | Снижение токенов | Качество (Solve Rate) |
|---|---|---|---|
| Claude Code (Sonnet 5, SkillsBench) | −17.9% (медиана) | −22% | Без изменений (p=0.77) |
| Codex CLI (gpt-5.6-luna, Java SWE-bench) | −4.4% [−7.5, −1.5] | −20% (tool calls) | Без изменений (p=0.22) |
| Общий эффект (зависит от «раздутия» сессии) | −10% до −18% | — | — |
Важно отметить: внедрение навыка в виде папки с файлами (discoverable skill folder) не дало эффекта (−0.5%, статистически незначимо), так как агенты тратили токены на поиск самого файла SKILL.md. Эффект достигается только при прямом инжектировании инструкции в системный промпт.
Как внедрить Benjamin Plus
Навык распространяется под лицензией MIT. Интеграция требует добавления файла injected-instruction.md (~3 KB) в системный контекст агента. Вот примеры для популярных инструментов:
- Claude Code: Добавьте хук в
~/.claude/settings.jsonдля командыcat ~/.benjamin-plus/injected-instruction.mdпри старте сессии. Либо, для проекта без конфигурации, добавьте содержимое файла вCLAUDE.md. - Codex CLI: Добавьте содержимое файла в
AGENTS.mdв корне репозитория или в/.codex/AGENTS.md. - Другие агенты: Просто добавьте содержимое
injected-instruction.mdв начало системного промпта.
Репозиторий с исходным кодом и документацией доступен по адресу github.com/JetBrains/benjamin-plus-skill. Авторы призывают сообщество тестировать навык на своих стеках и сообщать о регрессиях или случаях, где оптимизация может быть неэффективной.
Источник: Github ↗
