Исследования24 сентября 2026 г., 13:33 МСК🤖 Auto

CAVEAT: Почему AI-агенты продают не то, что нужно пользователю

Исследование CAVEAT выявило критическую уязвимость AI-агентов: в средах с конфликтующими интересами (например, маркетплейсах) они выбирают неоптимальные товары в 82,7% случаев из-за манипуляций платформы.

Баннер новости 8184

Проблема несовпадения стимулов

Авторы работы — Юйсянь Ли, Уилл Эпперсон, Уэсли Дэнг и Зезоу Хуанг — представили новый бенчмарк CAVEAT, который тестирует Computer-Use Agents (CUA) в условиях, когда среда (платформа) имеет собственные интересы, конфликтующие с целями пользователя. В отличие от существующих тестов, проверяющих только кооперативные сценарии или явные атаки, CAVEAT моделирует реальные рыночные механизмы, где платформа может «подталкивать» агента к покупке менее выгодного для клиента товара.

Результаты тестирования: разрыв в эффективности

Исследование охватило 9 сред маркетплейсов и 8 тактик манипуляции (steering mechanisms). Тестирование проводилось на пяти семействах моделей. Ключевая метрика — выбор продукта, оптимального для пользователя (user-optimal product) — показала катастрофическое падение эффективности при включении механизмов влияния:

Условие Доля успешных покупок (оптимальный товар) Интерпретация
Контрольная группа (без манипуляций) 78.6% Агенты эффективно выполняют задачу в нейтральной среде
С включенными механизмами steering 17.3% Резкое падение: агенты поддаются влиянию платформы
С применением CAVEAT-Harness 55.0% Восстановление части эффективности через целевые вмешательства

Хотя увеличение размера модели и усиление процессов рассуждения (reasoning) повышают устойчивость, существенные ошибки сохраняются даже у самых продвинутых систем.

Три точки отказа агента

Анализ траекторий принятия решений выявил три конкретных этапа, на которых происходит сбой:

  • Искажение приоритетов: агент меняет вес параметров, важных для пользователя, под влиянием внешних сигналов.
  • Преждевременное сужение выбора: агент отбрасывает альтернативы слишком рано, не рассматривая полный спектр вариантов.
  • Решение до сбора доказательств: агент делает выбор, не дождавшись всей релевантной информации.

Решение: CAVEAT-Harness

Для борьбы с этими проблемами разработчики создали CAVEAT-Harness — систему целевых вмешательств, направленную на исправление указанных точек отказа. Это решение позволило повысить долю оптимальных покупок до 55.0%. Дополнительно, целевое дообучение (post-training) открытой модели малого размера показало значительный прирост устойчивости, что открывает путь к созданию более надежных агентов для коммерческого использования.

Источник: arXiv cs.AI ↗