Проблема: точность ответа vs. стоимость процесса
Кодовые агенты (coding agents) всё чаще работают с библиотеками самостоятельно: они выбирают инструменты, пишут код, запускают его и отлаживают ошибки. Традиционные бенчмарки проверяют только финальный результат, игнорируя путь к нему. Hugging Face выпустила инструмент, который измеряет effort (усилия) агента: количество токенов, время выполнения, число итераций и наличие ошибок. Это позволяет оценить, насколько хорошо библиотека (на примере transformers) спроектирована для взаимодействия с ИИ-агентами.
Методология: три уровня доступа
Для оценки использовалась система Hugging Face Jobs, где каждый запуск (модель × ревизия × задача) выполнялся на идентичном оборудовании. Агенты (на базе модели pi) получали три разных уровня контекста:
- bare: только установка через
pip install, без документации. - clone: полный исходный код библиотеки в рабочей директории.
- skill: упакованная документация CLI и примеры задач, загруженные в контекст.
Важно отметить, что эти уровни не являются вложенными: skill не содержит исходного кода, а clone не содержит структурированной документации. Это позволяет изолировать влияние разных типов помощи на эффективность агента.
Ключевые метрики и результаты
Исследование фокусировалось на детерминированных задачах (например, классификация тональности текста), где можно точно сравнить результат. Были измерены следующие параметры:
| Метрика | Описание | Значение для оптимизации |
|---|---|---|
| Match % | Процент успешных ответов (точное совпадение или подстрока) | Показывает, справляется ли модель с задачей вообще |
| Median Tokens | Медианное количество сгенерированных токенов | Прокси-метрика стоимости и сложности пути агента |
| Median Time | Медианное время выполнения задачи | Влияет на UX и скорость итераций |
| Runs with Error % | Доля запусков с ошибками или нулевым выводом | Выявляет «тихие» сбои, которые не дают ответа |
Практический кейс: CLI против Python-скриптов
Авторы приводят пример классификации тональности текста. Один агент написал 40-строчный Python-скрипт, импортировал библиотеки, обрабатывал тензоры PyTorch и отлаживал ошибки форматов. Другой агент использовал оптимизированный CLI-интерфейс одной командой:
transformers classify --model ... --text "..."
Оба агента получили правильный ответ (POSITIVE), но второй вариант потребовал значительно меньше токенов и времени. Ранее аналогичная оптимизация для hf CLI дала сокращение использования токенов в 1.3–1.8 раза (до 6 раз в отдельных сценариях). Данный бенчмарк позволяет масштабировать этот подход на другие библиотеки.
Почему это важно для разработчиков
Статья формулирует два новых принципа разработки ПО для эпохи агентов:
- If it isn't tested, then it doesn't work — если инструмент не протестирован на реальных агентах, он может быть бесполезен.
- If it isn't documented, then it doesn't exist — для агента отсутствие четкой, структурированной документации равносильно отсутствию функции.
Разработчикам библиотек рекомендуется внедрять CLI, создавать «Skills» (пакеты с документацией и примерами) и тестировать свои API именно с точки зрения того, как их используют LLM-агенты, а не только люди.
Источник: Hugging Face blog ↗
