Проблема «бенчмарк-иллюзии»
Традиционные метрики AI-агентов часто вводят в заблуждение. Модель может показывать отличные результаты на тестовых наборах, но быть непригодной для реальных рабочих процессов из-за высоких требований к человеческому надзору или неприемлемой стоимости. Авторы работы — команда из 17 исследователей во главе с Вероникой Чатрат (Veronica Chatrath) — предлагают новый подход: оценивать агента не по тому, насколько хорошо он работает, а по тому, при каких условиях он может быть надежно развернут.
Что такое READY?
READY (Reliable Enterprise Agent Deployment) — это открытый тестовый стенд, который связывает спецификацию рабочего процесса, выполнение, оценку и квалификацию агента. Фреймворк позволяет:
- Сохранять собственное определение успешного выполнения для каждого бизнес-процесса.
- Измерять надежность и операционные затраты системы «человек-ИИ».
- Выбирать политику надзора с минимальной стоимостью, удовлетворяющую целевому уровню надежности.
- Статистически квалифицировать агента на отложенных данных (held-out cases).
Кейс: Клинический аудит
Для проверки методологии исследователи провели сквозное исследование в сфере клинического аудита, протестировав 16 систем агентов на 750 случаях. Результаты выявили критические различия, скрытые при оценке автономной точности:
| Метрика | Система А | Система Б |
|---|---|---|
| Автономная точность | 72.8% | 72.5% |
| Разница в точности | Всего 0.3% | |
| Требуемый человеческий обзор для квалификации (при цели 76%) | 39.2% | 29.6% |
| Разница в нагрузке на человека | +9.6 процентных пунктов (значительная разница в стоимости) | |
Как видно из таблицы, система с чуть более высокой автономной точностью (72.8%) требует на 9.6% больше ручного вмешательства для достижения того же целевого уровня надежности (76%), что делает её менее выгодной для внедрения, чем система с более низкой автономной точностью.
Почему это важно для индустрии
READY смещает фокус с абстрактных бенчмарков на экономически обоснованные решения. Фреймворк предоставляет профиль развертывания, который четко характеризует:
- Достигнутый уровень надежности.
- Нагрузку на человеческий надзор.
- Операционные затраты.
Это позволяет компаниям сравнивать AI-системы на единой основе, устанавливать реалистичные требования к надзору и принимать решения о внедрении, основанные на статистически значимых данных, а не на маркетинговых заявлениях о «высокой точности».
Источник: arXiv cs.AI ↗
