Проблема оценки: успех ≠ надежность
Традиционные метрики оценки AI-агентов (LLM Agents) фокусируются исключительно на outcome metrics — то есть на том, выполнил ли агент задачу или нет. Однако новый подход, описанный в исследовании arXiv:2608.13598, доказывает, что это упускает из виду критически важное свойство: поведенческую согласованность (behavioral consistency). Агент может успешно решить задачу, но делать это хаотично, используя разные стратегии в похожих ситуациях, что делает его поведение непредсказуемым и опасным для критических приложений.
Как работает BCM: от трассировки к векторам атрибуции
Авторы предлагают метрику Behavioral Consistency Metric (BCM), которая количественно измеряет стабильность поведения. Процесс оценки включает несколько этапов:
- Анализ трассировок (execution traces): Система собирает данные о каждом шаге выполнения задачи агентом.
- Обучение предиктора: Специальная модель обучается предсказывать успех задачи на основе поведенческих признаков агента.
- Векторы атрибуции: Для каждого отдельного выполнения (trajectory) выводится вектор атрибуции признаков, показывающий, какие именно действия повлияли на результат.
- Измерение сходства: BCM вычисляет среднюю попарную схожесть этих векторов внутри системы агента. Высокая схожесть означает, что агент действует предсказуемо и стабильно.
Почему это важно для индустрии
Внедрение BCM позволяет разработчикам и аудиторам отличать «удачный» запуск от надежного алгоритма. Если два агента имеют одинаковый Success Rate, но разный BCM, второй агент будет вести себя более детерминировано, что упрощает отладку, безопасность и интеграцию в бизнес-процессы. Это переход от оценки «что получилось» к оценке «как это было сделано».
Ключевые выводы
Исследование подчеркивает, что поведенческая согласованность является отдельным и измеримым свойством, которое должно учитываться наряду с точностью. Без таких метрик, как BCM, оценка качества современных LLM-агентов остается неполной и может скрывать нестабильность их работы.
Источник: arXiv cs.AI ↗
