Инструменты6 июля 2026 г., 15:17 МСК🤖 Auto

Забудьте про средние баллы: новый метод оценки AI-агентов

Исследование показывает, что ранжирование конфигураций AI-агентов по среднему баллу искажает реальную эффективность. Предлагается использовать MaxDiff и модель Plackett-Luce для точного выбора лучших моделей.

Баннер новости 2955

Проблема среднего балла

В индустрии AI-агентов сложилась привычка оценивать качество конфигураций (настроек моделей, промптов, цепочек действий) через усредненные метрики. Однако такой подход часто скрывает критические недостатки. Агент может показывать высокий средний балл, но при этом регулярно проваливать самые важные сценарии использования, что делает его непригодным для продакшена.

Альтернатива: Pairwise и MaxDiff

Авторы статьи предлагают отказаться от агрегации в пользу best-worst comparisons (сравнений «лучший-худший») и методов, основанных на MaxDiff (Maximum Difference Scaling). Этот подход заставляет оценщиков (или другие модели) выбирать не просто «оценку 8 из 10», а определять, какая конфигурация работает лучше в парном сравнении, а какая — хуже всего в конкретном контексте.

Математическая основа: Plackett-Luce

Для обработки результатов таких сравнений предлагается использовать модель Plackett-Luce. Эта статистическая модель позволяет вычислять утилитарные оценки (utility scores) для каждой конфигурации, учитывая не только частоту побед, но и силу соперников. Это дает более чистую и надежную картину эффективности, чем простое усреднение.

Практическая польза для разработчиков

Использование этих методов позволяет командам:

  • Точечно отсекать (prune) слабые конфигурации, которые маскируются под «среднехорошие» в традиционных метриках.
  • Оптимизировать роутинг запросов, направляя сложные задачи в конфигурации с наивысшей утилитой Plackett-Luce.
  • Принимать решения о релизах на основе устойчивых предпочтений, а не шумных средних значений.
Метод оценки Как работает Главный недостаток Преимущество
Средний балл (Average Score) Агрегация всех оценок в одно число Скрывает дисперсию и провалы в критических сценариях Простота расчета
Best-Worst / MaxDiff Выбор лучшего и худшего из набора Требует больше ресурсов на оценку Выявляет реальные лидеры и аутсайдеры
Plackett-Luce Utility Статистическая модель предпочтений Сложность интерпретации для не-математиков Учитывает силу контекста и соперников

Переход от средних значений к парным сравнениям и вероятностным моделям — это шаг к более инженерно обоснованному выбору AI-конфигураций, где важна не «средняя температура по больнице», а стабильность работы в крайних случаях.

Источник: Towards Data Science ↗