Инструменты1 июля 2026 г., 06:19 МСК🤖 Auto

Hugging Face: как измерить «агентность» моделей и оптимизировать API

Hugging Face представила новый бенчмарк, оценивающий не только точность ответов LLM, но и стоимость их достижения. Исследование показало, что оптимизация CLI для агентов сокращает использование токенов до 6 раз.

Баннер новости 2708

Проблема: точность ответа vs. стоимость процесса

Кодовые агенты (coding agents) всё чаще работают с библиотеками самостоятельно: они выбирают инструменты, пишут код, запускают его и отлаживают ошибки. Традиционные бенчмарки проверяют только финальный результат, игнорируя путь к нему. Hugging Face выпустила инструмент, который измеряет effort (усилия) агента: количество токенов, время выполнения, число итераций и наличие ошибок. Это позволяет оценить, насколько хорошо библиотека (на примере transformers) спроектирована для взаимодействия с ИИ-агентами.

Методология: три уровня доступа

Для оценки использовалась система Hugging Face Jobs, где каждый запуск (модель × ревизия × задача) выполнялся на идентичном оборудовании. Агенты (на базе модели pi) получали три разных уровня контекста:

  • bare: только установка через pip install, без документации.
  • clone: полный исходный код библиотеки в рабочей директории.
  • skill: упакованная документация CLI и примеры задач, загруженные в контекст.

Важно отметить, что эти уровни не являются вложенными: skill не содержит исходного кода, а clone не содержит структурированной документации. Это позволяет изолировать влияние разных типов помощи на эффективность агента.

Ключевые метрики и результаты

Исследование фокусировалось на детерминированных задачах (например, классификация тональности текста), где можно точно сравнить результат. Были измерены следующие параметры:

Метрика Описание Значение для оптимизации
Match % Процент успешных ответов (точное совпадение или подстрока) Показывает, справляется ли модель с задачей вообще
Median Tokens Медианное количество сгенерированных токенов Прокси-метрика стоимости и сложности пути агента
Median Time Медианное время выполнения задачи Влияет на UX и скорость итераций
Runs with Error % Доля запусков с ошибками или нулевым выводом Выявляет «тихие» сбои, которые не дают ответа

Практический кейс: CLI против Python-скриптов

Авторы приводят пример классификации тональности текста. Один агент написал 40-строчный Python-скрипт, импортировал библиотеки, обрабатывал тензоры PyTorch и отлаживал ошибки форматов. Другой агент использовал оптимизированный CLI-интерфейс одной командой:

transformers classify --model ... --text "..."

Оба агента получили правильный ответ (POSITIVE), но второй вариант потребовал значительно меньше токенов и времени. Ранее аналогичная оптимизация для hf CLI дала сокращение использования токенов в 1.3–1.8 раза (до 6 раз в отдельных сценариях). Данный бенчмарк позволяет масштабировать этот подход на другие библиотеки.

Почему это важно для разработчиков

Статья формулирует два новых принципа разработки ПО для эпохи агентов:

  1. If it isn't tested, then it doesn't work — если инструмент не протестирован на реальных агентах, он может быть бесполезен.
  2. If it isn't documented, then it doesn't exist — для агента отсутствие четкой, структурированной документации равносильно отсутствию функции.

Разработчикам библиотек рекомендуется внедрять CLI, создавать «Skills» (пакеты с документацией и примерами) и тестировать свои API именно с точки зрения того, как их используют LLM-агенты, а не только люди.

Источник: Hugging Face blog ↗