Слепое пятно существующих защит
Современные методы защиты LLM-агентов фокусируются на выборе правильного инструмента (selection) или ограничении действий с реальными инструментами (gating). Однако эти подходы терпят неудачу, когда модель генерирует вызовы к инструментам, которых не существует, или передает аргументы, не описанные в схеме. Автор исследования Лакшмиприя Ганеш Айер доказывает, что это структурная уязвимость: «галлюцинирующий вызов по определению не является решением, которое мог бы принять шлюз, поэтому ни один шлюз не может его отклонить».
Тестирование на реальных моделях
Исследователи провели бенчмарк на 10 хостинговых моделях, используя две поверхности вызовов. Ключевой вывод: увеличение масштаба модели не решает проблему. Модель на 675 миллиардов параметров демонстрирует тот же уровень галлюцинаций, что и модель на 7–8 миллиардов. Основная масса ложных вызовов (34 из 37) происходит на поверхности неструктурированного JSON, где нет жесткой схемы.
| Метрика / Поверхность | Количество галлюцинаций | Примечание |
|---|---|---|
| Всего выявлено | 322 | Истинные галлюцинации инструментов |
| Поверхность Raw JSON | 34 | Высокий риск, отсутствие схемы |
| Другая поверхность | 3 | Структурированный вызов |
| Model Context Protocol (MCP) | 154 | Включая фронтенр-модели |
Уязвимость протокола MCP
Особую опасность представляет протокол Model Context Protocol (MCP). При объединении нескольких серверов в одно пространство имен возникают коллизии и теневое затенение (shadowing). Это создает новые поверхности для галлюцинаций, которые невозможно выразить через единый реестр. В тестах на живом интерфейсе MCP было зафиксировано 154 галлюцинации, включая вызовы от передовых моделей, которые были «чистыми» при тестировании на одиночном реестре.
Предлагаемое решение: Closed-World Resolution
Авторы предлагают метод «Closed-World Resolution» — решение без дообучения, основанное на проверке членства в реестре и цифровой подписи. Исследование подчеркивает, что защита от галлюцинаций должна предшествовать любому причинно-следственному шлюзу. Для стандартизации тестов выпущен версионированный бенчмарк Hallucinated-Tools Benchmark (HTB).
Источник: arXiv cs.AI ↗
