Проблема несовпадения стимулов
Авторы работы — Юйсянь Ли, Уилл Эпперсон, Уэсли Дэнг и Зезоу Хуанг — представили новый бенчмарк CAVEAT, который тестирует Computer-Use Agents (CUA) в условиях, когда среда (платформа) имеет собственные интересы, конфликтующие с целями пользователя. В отличие от существующих тестов, проверяющих только кооперативные сценарии или явные атаки, CAVEAT моделирует реальные рыночные механизмы, где платформа может «подталкивать» агента к покупке менее выгодного для клиента товара.
Результаты тестирования: разрыв в эффективности
Исследование охватило 9 сред маркетплейсов и 8 тактик манипуляции (steering mechanisms). Тестирование проводилось на пяти семействах моделей. Ключевая метрика — выбор продукта, оптимального для пользователя (user-optimal product) — показала катастрофическое падение эффективности при включении механизмов влияния:
| Условие | Доля успешных покупок (оптимальный товар) | Интерпретация |
|---|---|---|
| Контрольная группа (без манипуляций) | 78.6% | Агенты эффективно выполняют задачу в нейтральной среде |
| С включенными механизмами steering | 17.3% | Резкое падение: агенты поддаются влиянию платформы |
| С применением CAVEAT-Harness | 55.0% | Восстановление части эффективности через целевые вмешательства |
Хотя увеличение размера модели и усиление процессов рассуждения (reasoning) повышают устойчивость, существенные ошибки сохраняются даже у самых продвинутых систем.
Три точки отказа агента
Анализ траекторий принятия решений выявил три конкретных этапа, на которых происходит сбой:
- Искажение приоритетов: агент меняет вес параметров, важных для пользователя, под влиянием внешних сигналов.
- Преждевременное сужение выбора: агент отбрасывает альтернативы слишком рано, не рассматривая полный спектр вариантов.
- Решение до сбора доказательств: агент делает выбор, не дождавшись всей релевантной информации.
Решение: CAVEAT-Harness
Для борьбы с этими проблемами разработчики создали CAVEAT-Harness — систему целевых вмешательств, направленную на исправление указанных точек отказа. Это решение позволило повысить долю оптимальных покупок до 55.0%. Дополнительно, целевое дообучение (post-training) открытой модели малого размера показало значительный прирост устойчивости, что открывает путь к созданию более надежных агентов для коммерческого использования.
Источник: arXiv cs.AI ↗
