Проблема слепой исполнительности
Графические пользовательские интерфейсы (GUI) агенты становятся все более распространенными для выполнения задач по естественному языку. Однако пользователи часто формулируют нереализуемые инструкции из-за опечаток или непонимания ограничений системы. Ключевая проблема современных агентов заключается в том, что они склонны к overcompliance (чрезмерному послушанию): даже если задача технически невозможна, агент продолжает пытаться ее выполнить, тратя ресурсы и потенциально вызывая ошибки.
Новый бенчмарк: CONFLICTGUI
Команда авторов представила CONFLICTGUI — специализированный набор данных для оценки «конфликт-осознанного завершения» (conflict-aware termination). Бенчмарк охватывает два типа конфликтов:
- Внутренние конфликты инструкции: противоречия внутри самого запроса пользователя.
- Конфликты инструкции и контекста GUI: ситуации, когда запрос противоречит текущему состоянию интерфейса (например, попытка нажать кнопку, которой нет на экране).
Решение: CONFLICTGUARD
Для решения проблемы исследователи разработали CONFLICTGUARD — фреймворк времени инференса (inference-time), который не требует дообучения моделей. Он состоит из двух компонентов:
- Протокол проверки реализуемости (Feasibility Verification Protocol): заставляет агента оценить логику инструкции и наличие визуальных доказательств в GUI перед действием.
- Механизм модуляции действий (Conditional Action Modulation): перенаправляет агента от слепого выполнения к поведению, ориентированному на корректное завершение задачи (termination).
Результаты и метрики
Эксперименты проводились на пяти широко используемых GUI-агентах. Метод CONFLICTGUARD продемонстрировал значительное улучшение способности агентов идентифицировать невозможные сценарии, сохраняя при этом высокую эффективность на стандартных задачах.
| Компонент системы | Функция | Влияние на результат |
|---|---|---|
| CONFLICTGUI (Бенчмарк) | Тестирование на конфликтах инструкций и GUI | Выявил серьезную проблему «слепой исполнительности» у SOTA-моделей |
| CONFLICTGUARD (Фреймворк) | Инференс-тайм интервенция (без дообучения) | Улучшает успех на конфликтных задачах без падения производительности на обычных |
| Feasibility Verification | Анализ логики и визуальных данных | Позволяет агенту «понять», что задача невыполнима |
| Conditional Action Modulation | Корректировка стратегии действий | Переключает агента с выполнения на корректное завершение (stop) |
Результаты подтверждают, что легковесное вмешательство на этапе инференса может существенно повысить компетентность GUI-агентов, заставляя их не только знать, как действовать, но и когда не действовать.
Источник: arXiv cs.AI ↗
