Кризис текущей парадигмы
В статье arXiv:2608.13577 («AI Evaluation Should Work With Humans») авторы подвергают критике доминирующий подход к оценке искусственного интеллекта. Традиционно метрики ориентированы на автономное превосходство (superhuman autonomous performance), что неявно ставит целью полную замену человека. Авторы утверждают, что такой вектор развития ведет ИИ в тупик, создавая системы, которые эффективны в вакууме, но разрушительны в реальной рабочей среде.
Сдвиг фокуса: от замены к комплементарности
Предлагается перейти к оценке производительности человечно-машинных команд (human-AI teams). Ключевая идея заключается в том, что ИИ должен выступать истинным дополнением (complement) к человеческим способностям, а не их конкурентом. Такой подход, по мнению авторов, приведет к значительно лучшим социальным и экономическим результатам, чем текущая гонка вооружений автономных агентов.
Почему это важно для индустрии
Текущие бенчмарки часто игнорируют когнитивную нагрузку на человека, время на интеграцию ИИ-рекомендаций и ошибки коммуникации. Оценка «человек + ИИ» требует новых метрик, учитывающих:
- Синергию навыков: как ИИ закрывает слабые места человека и наоборот.
- Надежность взаимодействия: доверие пользователя к рекомендациям системы.
- Эффективность процесса: снижение времени принятия решений при сохранении качества.
Вывод
Отказ от изолированного тестирования моделей в пользу комплексной оценки их работы в связке с человеком — это не просто этический выбор, а практическая необходимость для создания устойчивых и полезных AI-систем следующего поколения.
Источник: arXiv cs.AI ↗
