Проблема бинарной оценки
Большинство существующих бенчмарков для оценки кодовых агентов сводят результат выполнения задачи к бинарному значению: задача решена или нет. Однако пользователи реальных продуктов сталкиваются с полным траекторным опытом (trajectory): как агент следует инструкциям, использует инструменты, верифицирует собственный код, восстанавливается после ошибок и общается с пользователем. AgentLens закрывает этот пробел, предлагая комплексную оценку всего процесса взаимодействия.
Методология: Верификация + LLM-анализ
AgentLens сочетает формальную верификацию (для задач с объективным критерием успеха) с анализом, сгенерированным LLM. Система создает подробные обзоры траектории и сравнения «бок о бок» (side-by-side), объясняя, почему агент получил ту или иную оценку. Это превращает бенчмарк из простого рейтинга в инструмент диагностики поведения моделей.
Практическое применение
Исследователи уже интегрировали AgentLens в ночной пайплайн оценки (nightly evaluation pipeline) для выявления регрессий в продуктах. Методология позволяет сравнивать последовательные версии собственных агентов, выявляя не только падение точности кода, но и ухудшение качества взаимодействия.
Ключевые метрики и компоненты
| Компонент оценки | Описание | Что измеряется
|---|---|
| Формальная верификация | Объективная проверка корректности результата (pass/fail для детерминированных задач) |
| LLM-written trajectory reviews | Натуральноязыковое объяснение действий агента, использования инструментов и восстановления после ошибок |
| Side-by-side comparisons | Визуальное и текстовое сравнение траекторий разных моделей или версий одного агента |
Открытый доступ
Бенчмарк AgentLens выпущен в открытом доступе. Исследователи подчеркивают, что такой подход необходим для перехода от «черного ящика» к прозрачной диагностике кодовых агентов в production-среде. Полный код и данные доступны по ссылке, указанной в статье.
Источник: arXiv cs.AI ↗
