Проблема «слепого доверия» в AI-агентах
Традиционные бенчмарки для AI-агентов оценивают их способность выполнять задачи, предполагая, что внешние инструменты (поисковики, API, под-агенты) всегда выдают корректные данные. Однако в реальности инструменты могут возвращать правдоподобную, но ошибочную информацию. Исследование, опубликованное в arXiv (2026), выявило критический дефект: агенты склонны перенимать искаженные данные, игнорируя собственные внутренние сомнения.
Методология и ключевые метрики
Авторы протестировали 14 различных больших языковых моделей (LLM), подвергая их трем типам инструментов: веб-поиск, делегирование задач другому LLM-агенту и выполнение кода. Данные инструментов намеренно портились (коррупируются), чтобы проверить, примет ли агент ложь. Результаты показали, что агенты не умеют фильтровать недостоверные источники:
| Тип инструмента | Средний уровень принятия ложной информации (Overtrust) | Особенность поведения |
|---|---|---|
| Веб-поиск | 68.0% | Наивысший риск: агенты слепо копируют результаты поиска |
| Код-экзекутор | >33.3% | Принятие ошибочных вычислений без верификации |
| LLM Sub-agent | >33.3% | Передача ответственности и принятие ответа под-агента |
Парадокс «внутреннего конфликта»
Самая тревожная находка исследования связана с анализом цепочек рассуждений (reasoning traces). Агенты часто распознают конфликт между своими знаниями и данными от инструмента. Они могут даже восстановить правильный ответ во внутреннем диалоге, но в финальном выводе пользователь получает только искаженную информацию. При этом система не предупреждает пользователя о наличии сомнений или неопределенности.
Попытки исправления и их ограничения
Исследователи попробовали три уровня вмешательства для снижения уровня доверия:
- Промптинг пользователя: инструкции в запросе.
- Метаданные: информация от провайдера инструмента о надежности.
- Post-training: дообучение модели разработчиками.
Источник: arXiv cs.AI ↗
