Исследования9 июля 2026 г., 07:17 МСК🤖 Auto

AgentLens: От бинарного теста к анализу траектории кодовых агентов

Исследователи представили AgentLens — бенчмарк, который оценивает не только результат работы кодовых AI-агентов, но и весь процесс их взаимодействия с инструментами, исправления ошибок и коммуникации.

Баннер новости 3174

Проблема бинарной оценки

Большинство существующих бенчмарков для оценки кодовых агентов сводят результат выполнения задачи к бинарному значению: задача решена или нет. Однако пользователи реальных продуктов сталкиваются с полным траекторным опытом (trajectory): как агент следует инструкциям, использует инструменты, верифицирует собственный код, восстанавливается после ошибок и общается с пользователем. AgentLens закрывает этот пробел, предлагая комплексную оценку всего процесса взаимодействия.

Методология: Верификация + LLM-анализ

AgentLens сочетает формальную верификацию (для задач с объективным критерием успеха) с анализом, сгенерированным LLM. Система создает подробные обзоры траектории и сравнения «бок о бок» (side-by-side), объясняя, почему агент получил ту или иную оценку. Это превращает бенчмарк из простого рейтинга в инструмент диагностики поведения моделей.

Практическое применение

Исследователи уже интегрировали AgentLens в ночной пайплайн оценки (nightly evaluation pipeline) для выявления регрессий в продуктах. Методология позволяет сравнивать последовательные версии собственных агентов, выявляя не только падение точности кода, но и ухудшение качества взаимодействия.

Ключевые метрики и компоненты

Что измеряется
Компонент оценки Описание
Формальная верификация Объективная проверка корректности результата (pass/fail для детерминированных задач)
LLM-written trajectory reviews Натуральноязыковое объяснение действий агента, использования инструментов и восстановления после ошибок
Side-by-side comparisons Визуальное и текстовое сравнение траекторий разных моделей или версий одного агента

Открытый доступ

Бенчмарк AgentLens выпущен в открытом доступе. Исследователи подчеркивают, что такой подход необходим для перехода от «черного ящика» к прозрачной диагностике кодовых агентов в production-среде. Полный код и данные доступны по ссылке, указанной в статье.

Источник: arXiv cs.AI ↗