Исследования4 сентября 2026 г., 06:17 МСК🤖 Auto

READY: Почему 72.8% точности недостаточно для Enterprise AI

Исследователи представили фреймворк READY, который доказывает: автономная точность агента не гарантирует его пригодность для бизнеса. На примере клинического аудита показано, как разница в 0.3% требует колоссальной разницы в человеческом контроле.

Баннер новости 6740

Проблема «бенчмарк-иллюзии»

Традиционные метрики AI-агентов часто вводят в заблуждение. Модель может показывать отличные результаты на тестовых наборах, но быть непригодной для реальных рабочих процессов из-за высоких требований к человеческому надзору или неприемлемой стоимости. Авторы работы — команда из 17 исследователей во главе с Вероникой Чатрат (Veronica Chatrath) — предлагают новый подход: оценивать агента не по тому, насколько хорошо он работает, а по тому, при каких условиях он может быть надежно развернут.

Что такое READY?

READY (Reliable Enterprise Agent Deployment) — это открытый тестовый стенд, который связывает спецификацию рабочего процесса, выполнение, оценку и квалификацию агента. Фреймворк позволяет:

  • Сохранять собственное определение успешного выполнения для каждого бизнес-процесса.
  • Измерять надежность и операционные затраты системы «человек-ИИ».
  • Выбирать политику надзора с минимальной стоимостью, удовлетворяющую целевому уровню надежности.
  • Статистически квалифицировать агента на отложенных данных (held-out cases).

Кейс: Клинический аудит

Для проверки методологии исследователи провели сквозное исследование в сфере клинического аудита, протестировав 16 систем агентов на 750 случаях. Результаты выявили критические различия, скрытые при оценке автономной точности:

Метрика Система А Система Б
Автономная точность 72.8% 72.5%
Разница в точности Всего 0.3%
Требуемый человеческий обзор для квалификации (при цели 76%) 39.2% 29.6%
Разница в нагрузке на человека +9.6 процентных пунктов (значительная разница в стоимости)

Как видно из таблицы, система с чуть более высокой автономной точностью (72.8%) требует на 9.6% больше ручного вмешательства для достижения того же целевого уровня надежности (76%), что делает её менее выгодной для внедрения, чем система с более низкой автономной точностью.

Почему это важно для индустрии

READY смещает фокус с абстрактных бенчмарков на экономически обоснованные решения. Фреймворк предоставляет профиль развертывания, который четко характеризует:

  1. Достигнутый уровень надежности.
  2. Нагрузку на человеческий надзор.
  3. Операционные затраты.

Это позволяет компаниям сравнивать AI-системы на единой основе, устанавливать реалистичные требования к надзору и принимать решения о внедрении, основанные на статистически значимых данных, а не на маркетинговых заявлениях о «высокой точности».

Источник: arXiv cs.AI ↗