Исследования2 октября 2026 г., 11:18 МСК🤖 Auto

GAVA: Как ИИ-агенты учатся принимать решения при ошибках пользователя

Исследователи представили GAVA — систему арбитража коррекций для текстовых embodied-агентов, которая снижает стоимость взаимодействия на 59,5% за счет семантических приоритетов.

Баннер новости 8766

Проблема: когда пользователь ошибается

Взаимодействие человека с ИИ-агентом часто требует корректировок. Но что делать агенту, если исправление пользователя неверно? Команда во главе с Е Чэнгом (Yezhou Cheng) разработала метод GAVA (Grounded Arbitration of User Corrections), который решает эту дилемму через четыре стратегии: принять исправление, отклонить его, провести локальную инспекцию мира или задать уточняющий вопрос.

Ключевая инновация — использование ограниченных наблюдений и правила одношагового ожидаемого ущерба (one-step expected-loss rule). Агент не просто слепо следует инструкциям, а оценивает достоверность данных на основе доступных символьных наблюдений.

Результаты: точность и экономия ресурсов

Эксперименты проводились в текстовой среде ALFWorld на 162 контрольных точках, что дало 972 пары истинных и ложных вмешательств. Система GAVA демонстрирует выдающуюся надежность:

Метрика Значение / Эффект Примечание
Точность коррекций (полная инспекция) 100% Установлен «контракт достоверности»
Снижение стоимости взаимодействия 0.490 (на 340 сценариях) Относительно uniform GAVA
Снижение объявленной совместной стоимости 0.420 (на 340 сценариях) Относительно uniform GAVA
Репликация результатов (77 точек) 0.595 (взаимодействие) / 0.517 (стоимость) 95% доверительный интервал исключает ноль
Точность Semantic GAVA 98.8% - 98.7% 4 фактические ошибки на когорту

Почему это важно

Исследование доказывает, что селективный сбор информации с использованием семантических приоритетов (prior) эффективнее, чем постоянная верификация или игнорирование контекста. Снижение стоимости взаимодействия на ~60% критично для масштабируемых агентов, где каждое лишнее действие (запрос, проверка) увеличивает latency и вычислительные затраты.

Однако авторы отмечают ограничения: тесты проводились на контролируемых спикерах без визуального ввода и реальных людей. Выводы применимы к текстовым симуляциям, но требуют валидации в физических роботах и при работе с человеческими пользователями.

Источник: arXiv cs.AI ↗