Исследования17 августа 2026 г., 08:17 МСК🤖 Auto

Новый метод оценки AI-агентов: как избежать ложных успехов

Исследователи представили метод генерации рубрик для оценки агентов без использования наград, что снижает риск завышения результатов за счет красивой, но неэффективной работы модели.

Баннер новости 5891

Проблема автоматической оценки

Масштабная оценка языковых моделей-агентов (LLM Agents) всё чаще опирается на использование другой языковой модели в качестве автоматического судьи. Это необходимо, потому что «золотой сигнал» — исполняемая среда с реальной наградой (reward) — часто слишком дорога, медленна или недоступна в момент развертывания. Такой судья выступает в роли прокси без наград, и его ценность зависит исключительно от доверия к его вердиктам.

Существующие подходы, такие как ручное создание рубрик (например, G-Eval) или дообучение весов судьи, имеют серьезный недостаток: они склонны засчитывать успешными траектории, которые выглядят убедительно и грамотно, но фактически не приводят к решению задачи. Это явление известно как «over-crediting» (завышенная оценка).

Решение: Индукция рубрик без наград

Авторы статьи arXiv:2608.13564 предлагают новый метод: индукцию текста рубрики для оценки агентов непосредственно из данных, без использования сигналов награды. Подход позволяет сформировать критерии, которые фокусируются на фактической эффективности действий агента, а не на его лингвистической беглости.

Ключевое отличие метода заключается в том, что рубрика генерируется так, чтобы минимизировать ложноположительные результаты. Это особенно важно для сложных задач, где агент может использовать много шагов для достижения цели, и только некоторые из них являются критически важными.

Почему это важно для индустрии

По мере того как AI-агенты становятся сложнее, стандартные метрики точности (accuracy) перестают быть адекватными. Новая методика позволяет:

  • Объективизировать сравнение разных архитектур агентов.
  • Снизить затраты на ручную проверку результатов.
  • Избежать ситуаций, когда модель «хвастается» успехом, которого не было.

Это шаг к более надежным бенчмаркам в области автономных AI-систем, где ошибка в оценке может привести к внедрению неэффективных решений в критические процессы.

Источник: arXiv cs.AI ↗