Исследования4 сентября 2026 г., 10:20 МСК🤖 Auto

CONFLICTGUI: Как научить GUI-агентов останавливаться, когда задача невозможна

Исследователи представили CONFLICTGUI — первый бенчмарк для оценки способности мультимодальных агентов распознавать конфликты в инструкциях. Предложенный метод CONFLICTGUARD снижает слепое выполнение задач без переобучения моделей.

Баннер новости 6756

Проблема слепой исполнительности

Графические пользовательские интерфейсы (GUI) агенты становятся все более распространенными для выполнения задач по естественному языку. Однако пользователи часто формулируют нереализуемые инструкции из-за опечаток или непонимания ограничений системы. Ключевая проблема современных агентов заключается в том, что они склонны к overcompliance (чрезмерному послушанию): даже если задача технически невозможна, агент продолжает пытаться ее выполнить, тратя ресурсы и потенциально вызывая ошибки.

Новый бенчмарк: CONFLICTGUI

Команда авторов представила CONFLICTGUI — специализированный набор данных для оценки «конфликт-осознанного завершения» (conflict-aware termination). Бенчмарк охватывает два типа конфликтов:

  • Внутренние конфликты инструкции: противоречия внутри самого запроса пользователя.
  • Конфликты инструкции и контекста GUI: ситуации, когда запрос противоречит текущему состоянию интерфейса (например, попытка нажать кнопку, которой нет на экране).

Решение: CONFLICTGUARD

Для решения проблемы исследователи разработали CONFLICTGUARD — фреймворк времени инференса (inference-time), который не требует дообучения моделей. Он состоит из двух компонентов:

  1. Протокол проверки реализуемости (Feasibility Verification Protocol): заставляет агента оценить логику инструкции и наличие визуальных доказательств в GUI перед действием.
  2. Механизм модуляции действий (Conditional Action Modulation): перенаправляет агента от слепого выполнения к поведению, ориентированному на корректное завершение задачи (termination).

Результаты и метрики

Эксперименты проводились на пяти широко используемых GUI-агентах. Метод CONFLICTGUARD продемонстрировал значительное улучшение способности агентов идентифицировать невозможные сценарии, сохраняя при этом высокую эффективность на стандартных задачах.

Компонент системы Функция Влияние на результат
CONFLICTGUI (Бенчмарк) Тестирование на конфликтах инструкций и GUI Выявил серьезную проблему «слепой исполнительности» у SOTA-моделей
CONFLICTGUARD (Фреймворк) Инференс-тайм интервенция (без дообучения) Улучшает успех на конфликтных задачах без падения производительности на обычных
Feasibility Verification Анализ логики и визуальных данных Позволяет агенту «понять», что задача невыполнима
Conditional Action Modulation Корректировка стратегии действий Переключает агента с выполнения на корректное завершение (stop)

Результаты подтверждают, что легковесное вмешательство на этапе инференса может существенно повысить компетентность GUI-агентов, заставляя их не только знать, как действовать, но и когда не действовать.

Источник: arXiv cs.AI ↗