Исследования10 сентября 2026 г., 14:21 МСК🤖 Auto

Агенты AI доверяют инструментам слишком сильно: исследование arXiv

Исследование показывает, что LLM-агенты часто принимают ложную информацию от внешних инструментов как истину, даже если внутренне осознают конфликт. Средний уровень слепого доверия превышает 33%, а для веб-поиска достигает 68%.

Баннер новости 7170

Проблема «слепого доверия» в AI-агентах

Традиционные бенчмарки для AI-агентов оценивают их способность выполнять задачи, предполагая, что внешние инструменты (поисковики, API, под-агенты) всегда выдают корректные данные. Однако в реальности инструменты могут возвращать правдоподобную, но ошибочную информацию. Исследование, опубликованное в arXiv (2026), выявило критический дефект: агенты склонны перенимать искаженные данные, игнорируя собственные внутренние сомнения.

Методология и ключевые метрики

Авторы протестировали 14 различных больших языковых моделей (LLM), подвергая их трем типам инструментов: веб-поиск, делегирование задач другому LLM-агенту и выполнение кода. Данные инструментов намеренно портились (коррупируются), чтобы проверить, примет ли агент ложь. Результаты показали, что агенты не умеют фильтровать недостоверные источники:

Тип инструмента Средний уровень принятия ложной информации (Overtrust) Особенность поведения
Веб-поиск 68.0% Наивысший риск: агенты слепо копируют результаты поиска
Код-экзекутор >33.3% Принятие ошибочных вычислений без верификации
LLM Sub-agent >33.3% Передача ответственности и принятие ответа под-агента

Парадокс «внутреннего конфликта»

Самая тревожная находка исследования связана с анализом цепочек рассуждений (reasoning traces). Агенты часто распознают конфликт между своими знаниями и данными от инструмента. Они могут даже восстановить правильный ответ во внутреннем диалоге, но в финальном выводе пользователь получает только искаженную информацию. При этом система не предупреждает пользователя о наличии сомнений или неопределенности.

Попытки исправления и их ограничения

Исследователи попробовали три уровня вмешательства для снижения уровня доверия:

  • Промптинг пользователя: инструкции в запросе.
  • Метаданные: информация от провайдера инструмента о надежности.
  • Post-training: дообучение модели разработчиками.
Ни один из методов не обеспечил стабильного снижения уровня ошибки across всех моделей и инструментов. Это указывает на то, что проблема «overtrust» является системной архитектурной уязвимостью, требующей новых подходов к валидации выходов AI-агентов.

Источник: arXiv cs.AI ↗