Исследования1 июля 2026 г., 13:17 МСК🤖 Auto

AI-агенты провалили тест: они не учат пользователей, а просто спрашивают

Исследование показывает, что даже передовые LLM не могут помочь пользователям сформировать запрос, если у тех нет экспертизы. Точность рекомендаций в новом бенчмарке CoShop не превысила 56%.

Баннер новости 2726

Проблема «экспертного пользователя»

Традиционные AI-агенты строятся на допущении, что пользователь точно знает, чего хочет. Если задача сформулирована размыто, система задает уточняющие вопросы. Авторы работы из Стэнфорда и других институтов (Irena Saracay, Ludwig Schmidt, Carlos Guestrin) утверждают, что это нереалистично. Пользователи часто не обладают достаточными знаниями в предметной области, чтобы сформировать четкие предпочтения. Им нужна помощь агента в обучении, а не просто сбор данных.

Новый подход: CoPref и CoShop

Для решения этой проблемы исследователи предложили модель CoPref (Constructive Preferences), основанную на фреймворке Search-Experience-Credence из экономики информации. В рамках этой модели агент должен не только извлекать предпочтения, но и помогать пользователю их конструировать через объяснения и примеры. Для тестирования создан интерактивный бенчмарк CoShop, где агенты ведут диалог с пользователями CoPref и делают рекомендации.

Результаты тестирования: провал передовых моделей

Команда протестировала пять ведущих коммерческих и открытых моделей. Оказалось, что ни одна из них не смогла преодолеть порог в 56% точности рекомендаций даже после пяти раундов взаимодействия. Главная проблема заключается не в неспособности агентов найти товар, а в их неспособности расширить знания пользователя о том, что ему действительно нужно.

Метрика / Характеристика Значение / Результат Комментарий
Максимальная точность (Accuracy) < 56% Достигнута лучшими моделями после 5 ходов диалога
Количество протестированных моделей 5 Фронтенд-модели рынка (SOTA)
Основная причина провала Низкая информативность Диалог не расширяет знания пользователя о его потребностях
Предлагаемое решение CoPref / CoShop Смещение фокуса с элиситации на конструирование предпочтений

Почему это важно

Результаты исследования ставят под сомнение текущую парадигму разработки рекомендательных систем. Если AI не может обучить пользователя в процессе диалога, он становится бесполезным для сложных задач выбора. Будущее агентов лежит не в улучшении поиска, а в развитии навыков педагогического взаимодействия и передачи предметной экспертизы.

Источник: arXiv cs.AI ↗